
Crawl4AI 快速上手AI 友好爬虫5 分钟把网页转成 Markdown【免费下载链接】crawl4ai Crawl4AI: Open-source LLM Friendly Web Crawler Scraper. Dont be shy, join here: https://discord.gg/jP8KfhDhyN项目地址: https://gitcode.com/GitHub_Trending/craw/crawl4aiCrawl4AI 是一个面向大模型场景的开源网页爬虫与抓取工具LLM Friendly Web Crawler Scraper。它把网页自动渲染并转换成干净、结构化的 Markdown 或 JSON输出可直接喂给 RAG 系统、AI 智能体和数据管道省去你手写 HTML 解析与清洗规则的工作。它是怎么工作的渲染、转换、提取三步走Crawl4AI 的爬取过程分三步先用无头浏览器不显示界面的真实浏览器内核默认 Chromium执行页面 JavaScript等动态内容加载完成再把 HTML 自动转成 Markdown标题、表格、代码块、链接引用都保留结构最后按需提取——可以用 CSS 选择器或 XPath 指定位置取数也可以把页面内容交给大模型LLM即语言大模型按你写的指令或 schema 输出 JSON。打个比方传统爬虫拿到的是没印刷好的空壳报纸Crawl4AI 则像一位会排版、会划重点的助理——先把报纸完整印出来再按你的要求整理成文档和表格。快速上手安装并跑通第一次爬取先安装并初始化浏览器依赖pip install -U crawl4ai crawl4ai-setup下面的最小脚本爬取一个新闻页面并打印 Markdown 输出import asyncio from crawl4ai import AsyncWebCrawler async def main(): async with AsyncWebCrawler() as crawler: result await crawler.arun(urlhttps://www.nbcnews.com/business) print(result.markdown[:500]) if __name__ __main__: asyncio.run(main())运行后你会看到页面正文被整理成带标题、列表和编号引用的干净 Markdown不再夹杂广告、导航栏和脚本代码可以直接作为大模型输入或存入知识库。这些场景能落地构建 RAG 知识库整站内容转成干净的 Markdown 文档链接自动变成编号引用列表省去HTML 转文本的清洗环节文档可以直接切块、入库供检索增强生成使用。列表页批量提取商品、房源、课程这类重复结构的页面用 CSS 选择器或 schema 定义字段输出 JSON 字符串也支持一次性让大模型生成可复用的 schema后续提取不再依赖模型调用零 token 成本。处理动态页面支持注入自定义 JavaScriptjs_code、等待特定元素、模拟滚动加载无限流内容并通过会话session复用登录状态处理需要点击加载更多或已登录才能看到的页面。用 LLM 做智能提取页面结构不规整时把提取策略换成 LLM 驱动用自然语言指令加 Pydantic 结构体描述想要的字段从非结构化正文中拿到规整 JSON。效果对比与传统做法相比维度传统做法requests 手写解析Crawl4AI动态内容JS 渲染页面常只抓到空 HTML 骨架内置浏览器渲染等待加载完成输出格式自己写规则转文本广告导航混在其中自动转结构化 Markdown含标题、表格、引用数据提取每类页面单独写解析代码CSS 选择器或 LLM 策略统一出 JSON批量任务自己写线程池、缓存、重试内置并发调度与缓存arun_many按内存自适应控制常见问题与调优首次安装后页面加载失败先执行crawl4ai-setup安装浏览器依赖仍异常时手动运行python -m playwright install --with-deps chromium再用crawl4ai-doctor检查环境。结果和内容不一致怀疑是缓存Crawl4AI 的默认缓存模式是CacheMode.BYPASS每次都抓新鲜内容只有显式设置为CacheMode.ENABLED才启用缓存。调试阶段保持默认即可。动态页面内容不全在CrawlerRunConfig中调大page_timeout页面加载超时单位毫秒或用wait_for指定等待的元素选择器无限滚动页面可开启模拟滚动full page scanning让内容全部加载。批量任务太慢或太占内存优先用arun_many()而不是自己开循环内置的内存自适应调度器会根据系统资源自动调整并发数开启流式模式streamTrue可以边完成边处理结果。爬取失败怎么定位检查result.success与result.error_message需要过滤掉噪音正文时给 Markdown 生成器配上内容过滤器读result.markdown.fit_markdown而非原始输出。参与贡献仓库地址https://gitcode.com/GitHub_Trending/craw/crawl4ai 欢迎提交 Issue 和 Pull Request也可加入官方 Discord 社区交流。现在安装 Crawl4AI爬出你的第一个 Markdown 吧。【免费下载链接】crawl4ai Crawl4AI: Open-source LLM Friendly Web Crawler Scraper. Dont be shy, join here: https://discord.gg/jP8KfhDhyN项目地址: https://gitcode.com/GitHub_Trending/craw/crawl4ai创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考