尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

wigolo fetch完全指南:JS渲染页面、PDF、认证会话如何变成干净Markdown

wigolo fetch完全指南:JS渲染页面、PDF、认证会话如何变成干净Markdown wigolo fetch完全指南JS渲染页面、PDF、认证会话如何变成干净Markdown【免费下载链接】wigoloThe go-to web for your AI coding agent — local-first search, fetch, crawl research over MCP. No API keys, no cloud, $0/query. Public beta.项目地址: https://gitcode.com/GitHub_Trending/wi/wigolowigolo fetch是本地优先local-first的网页抓取工具一条命令把网页变成干净的 Markdown——无需 API key、不上云、每次查询成本 $0。无论是 JS 渲染的 SPA 页面、PDF 文档还是登录后的私有页面它都能自动选对抓取策略输出 AI 代理可直接消费的文本。wigolo fetch 是什么为什么新手需要它普通爬虫拿到的是几百 KB 的原始 HTML导航栏、广告脚本、内联样式混杂在一起还要自己写解析逻辑。wigolo fetch 做的事是智能分层路由先用最快的纯 HTTP 请求遇到 SPA 空壳或反爬验证时自动升级而不是盲目地每个页面都启动浏览器三种引擎兜底普通 HTTP → TLS 指纹模拟 → 真实浏览器渲染Playwright逐层升级统一输出 Markdown正文、标题、链接、图片全部结构化为干净文本附带fetch_method告诉你这次实际走了哪条路径核心逻辑在 src/fetch/router.ts 中实现对外入口是 src/tools/fetch.ts。官方参数说明见 docs/tools.md。快速上手三步拿到干净 Markdown第 1 步安装 wigolo支持 npm、Homebrew、Docker、一键脚本详见 docs/installation.mdnpm install -g wigolo/cli # 或使用 Homebrew / 一键安装脚本第 2 步让 AI 代理接入 MCP或者直接 CLI 一次性调用wigolo mcp # 输出 MCP 服务器配置粘贴进 Claude Code / Cursor 等客户端第 3 步调用 fetch 工具只需传一个 URL其余都有合理默认值{ url: https://nextjs.org/docs/app/building-your-application/caching, section: Data Cache, max_content_chars: 4000 }下面是 CLI 一次性抓取的完整演示效果参数速查表只记住这 5 个就够用参数常用值什么时候用url必填要抓取的页面render_jsauto默认/always/never明确知道页面需要/不需要 JS 渲染时强制指定section/section_index标题文本长文档只要其中一节省 tokenmax_content_chars数字智能截断在段落边界切断优于硬切use_authtrue使用你已登录的浏览器会话完整参数还包括actions点击、输入、等待、滚动等浏览器操作序列、screenshot、headers、mode等见 docs/tools.md。JS 渲染页面SPA 空壳也能读很多现代站点react.dev、vuejs.org、nextjs.org 等首屏是空壳——正文全靠 JavaScript 挂载。wigolo 的应对是信号驱动而非域名猜测HTTP 请求后检测内容是否看起来为空或需要 JSlooksJsRequired信号已知重度客户端渲染的域名如react.dev会直接首发走浏览器渲染浏览器引擎池大小由MAX_BROWSERS控制默认 3抓取完成后自动回收响应中的js_required: true和content_completeness字段会诚实告诉你这是完整渲染的页面还是只是壳。相关实现分布在 src/fetch/playwright-tier.ts、src/fetch/hydration-probe.ts 与 src/fetch/content-check.ts。PDF 文档一个 URL 直接变 Markdown把 PDF 链接丢给 fetch 即可。引擎会识别application/pdf内容类型包括靠魔数字节识别的伪装 PDF提取文本后走同一套 Markdown 化管线输出和网页抓取完全一致的格式——标题、列表、表格都保留AI 代理拿来就能用。小贴士抓完的 PDF 同样进入本地知识缓存之后cache工具可以直接离线检索它重复查阅零成本。认证会话用自己的登录态读私有页面需要登录才能看的页面内部文档、付费内容、个人后台wigolo 支持复用你自己的浏览器会话而不是让 AI 替你输密码配置任一方式详见 docs/configuration.mdWIGOLO_CDP_URL附加到你正在运行的浏览器调试端口WIGOLO_CHROME_PROFILE_PATH指定一个 Chrome 用户目录WIGOLO_AUTH_STATE_PATH使用已保存的 storage-state 文件运行wigolo auth discover查看可附加的会话调用时加use_auth: truefetch / crawl 都会带上你的登录 Cookie安全提示使用真实会话意味着代理能读到你登录的内容请仅在受信任环境启用。反爬与诚实失败stealth 模式遇到反爬验证403、JS 质询页时wigolo 会自动升级到浏览器渲染 指纹加固WIGOLO_STEALTH默认auto仅在质询升级时开启实现见 src/fetch/stealth.ts等待质询通过若超时默认 15 秒返回明确的blocked_by_challenge标签——绝不返回垃圾内容冒充成功想手动走完整浏览器渲染把mode设为stealth即可排障细节见 docs/troubleshooting.md。缓存与变更检测抓过一次反复免费用wigolo 的核心哲学是cache first缓存优先每次 fetch 的结果写入本地知识缓存下次同 URL 直接秒回标记cached: true每次抓取附带content_hash全文 SHA-256可配合watch/diff工具做页面变更监控内容被截断不影响指纹——hash 基于截断前的完整正文计算变化不会因截断被漏报响应里还会附evidence关键证据段与metadata元数据、section_matched等让代理对结果可校验。常见问题Q怎么知道这次走了哪条路径看响应里的fetch_method字段如cache、http、browser可审计到字节级。Qlocalhost 本地开发服务器能抓吗可以。localhost / 127.0.0.1 被明确放行端口需合法SSRF 防护只拦截内网地址范围。QAI 代理怎么接入最省事见 Claude Code 快速上手示例examples/quickstart-claude-code/接入后 Agent 可自主决定何时 fetch、何时查缓存。延伸阅读工具全参数文档docs/tools.md浏览器引擎与认证环境变量docs/configuration.md路由与分层策略源码src/fetch/router.ts本地知识缓存docs/tools.md 中的cache工具【免费下载链接】wigoloThe go-to web for your AI coding agent — local-first search, fetch, crawl research over MCP. No API keys, no cloud, $0/query. Public beta.项目地址: https://gitcode.com/GitHub_Trending/wi/wigolo创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表