尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

Firecrawl 入门指南:把网页变成大模型能直接用的数据

Firecrawl 入门指南:把网页变成大模型能直接用的数据 Firecrawl 入门指南把网页变成大模型能直接用的数据【免费下载链接】firecrawlThe context API to search, scrape, and interact with the web at scale. 项目地址: https://gitcode.com/GitHub_Trending/fi/firecrawl给大模型喂网页多数人都卡在同一步requests 抓回来的是带导航栏和脚本的原始 HTML正则碰到 JS 渲染的页面直接失效反爬再挡一下代码就写不下去了。Firecrawl 就是一个开源的网页数据 API——你给它 URL它替你处理渲染、代理和反爬返回干净的 Markdown 或结构化 JSON直接进模型或数据库。一句话说清 Firecrawl 是干什么的把它理解成网页到数据之间的收费站所有脏活JS 渲染、代理轮换、限速对抗在收费站里完成你拿到的只剩干净内容。核心能力有五个Scrape任意 URL 转 Markdown、HTML、截图或结构化 JSONSearch搜全网并直接返回结果页的完整正文而不是一串链接Crawl / Map一次请求抓完整站或瞬间列出站内所有 URL结构化提取按你定义的 Schema 抽字段AI 负责填值Interact / Actions抓取后还能点按钮、滚动、输入应对需要交互的页面安装 SDK 与配置密钥三步跑通第一次抓取第一步装 SDKPython 用户执行pip install firecrawl-pyJavaScript 用户执行npm install mendable/firecrawl-js。第二步去 firecrawl.dev 注册一个 API Key有免费额度写入环境变量FIRECRAWL_API_KEY。第三步发第一个请求from firecrawl import Firecrawl app Firecrawl(api_keyfc-YOUR_API_KEY) result app.scrape(https://example.com) # 抓取任意网页 print(result.markdown)跑通后你会看到一段干净的 Markdown没有导航、没有脚本正文、标题层级、表格都原样保留。想先不写代码验证效果官方 Playground 可以在线试跑入口在 firecrawl.dev。盯住一个会变的数字自建价格跟踪器要做什么盯一个商品的价格手动刷新太累你需要一个定时抓取 历史落盘 趋势展示的闭环。怎么做仓库里的 Amazon 价格跟踪示例 就是完整套路——脚本每隔固定时间抓取商品页、用提取拿到当前价格、追加到数据库或 JSON 文件再套一个 Web 界面画历史曲线。调度不用自己维护挂到 GitHub Actions 的 cron 上即可仓库专门有一篇 定时抓取教程 讲这一步。核心逻辑只有一段Firecrawl 抓价格 Actions 管调度。拿到什么结果每天自动落盘一条价格记录界面上画出趋势图跌破阈值还能触发通知。用数据模型锁定页面字段一次抓全要做什么每天存一份 Hacker News 首页数据做分析。传统做法是写 CSS 选择器解析 HTML页面改版一次代码就崩。怎么做换一种写法——先用 Pydantic 定义我要什么而不是怎么解析。Hacker News 抓取器 的关键几行class NewsItem(BaseModel): title: str Field(description新闻标题) rank: str Field(description排名) upvotes: str Field(description点赞数) class NewsData(BaseModel): news_items: List[NewsItem] # 传入模型生成的 SchemaAI 照着字段逐个填 data app.scrape_url( https://news.ycombinator.com/, params{formats: [extract], extract: {schema: NewsData.model_json_schema()}}, )拿到什么结果一条命令得到 30 条完整新闻自动写入带时间戳的 JSON 文件。之后页面怎么改版都不影响你的字段定义只需要改模型。让程序自己翻页面做研究要做什么很多任务一页解决不了——比如帮我找某城市 2000 美元以下的一居室需要跨多个页面搜集、筛选、汇总。怎么做Firecrawl 的 deep research 能力可以整句自然语言查询交给它它自动搜索、跟链接、筛选再抓下一批页面循环多轮。公寓查找助手示例 的参数只有三个maxDepth迭代轮数示例设为 3、timeLimit总时长上限 180 秒、maxUrls最多分析 20 个 URL。脚本还注册了on_activity回调每一步动作都实时打印在终端过程完全透明。拿到什么结果几分钟后你拿到的不是一堆链接而是整理好的候选清单——价格、位置、设施、优缺点逐条列出再由大模型做最终排序推荐。进阶技巧与常见坑输出格式按需切换formats参数可以组合 markdown、html、json、screenshot。只喂模型就用 markdown 最省 token要留证据链就同时要 screenshot。整站抓取先试跑Crawl 支持limitURL 数上限、includePaths/excludePaths路径白黑名单先小批量确认范围再放大避免抓飞。字段抽错了改 Schema把字段的description写得更具体提取准确率会明显提升。被反爬挡住不用管代理轮换和对动态内容的处理是内置的这正是它替代手写 requests 的意义。想自托管仓库根目录自带 docker-compose.yaml克隆仓库后docker compose up就能本地起完整服务API、worker、Redis、Playwright 都在里面配合 SELF_HOST.md 看部署细节适合不想数据出内网的用户。更多玩法直接翻 examples/ 目录从内部链接 SEO 分析到监控告警照着改就行。写在最后Firecrawl 的价值一句话把从网页到可用数据这段最琐碎的路缩成一次 API 调用。完整功能看 README动手示例都在 examples 里。【免费下载链接】firecrawlThe context API to search, scrape, and interact with the web at scale. 项目地址: https://gitcode.com/GitHub_Trending/fi/firecrawl创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表