
MediaCrawler 多平台自媒体数据采集指南从安装到第一次抓取【免费下载链接】MediaCrawler小红书笔记 | 评论爬虫、抖音视频 | 评论爬虫、快手视频 | 评论爬虫、B 站视频 评论爬虫、微博帖子 评论爬虫、百度贴吧帖子 百度贴吧评论回复爬虫 | 知乎问答文章评论爬虫项目地址: https://gitcode.com/GitHub_Trending/me/MediaCrawlerMediaCrawler 是一个基于 Playwright 的开源爬虫项目按登录态抓取小红书、抖音、快手、B 站、微博、贴吧、知乎的笔记/视频、帖子及其评论结果落到本地文件或数据库。 它能帮你做什么监控某个关键词下的最新内容 → 按关键词跨七个平台搜索产出笔记/视频元数据加评论区数据复盘单个帖子 → 填帖子 ID 列表定向抓取该帖及对应评论分析某个创作者 → 填创作者 ID抓取其主页发布列表需要评论层级 → 开启二级评论抓取拿到楼中楼结构登录成本敏感 → 登录态按平台缓存到浏览器目录之后运行免扫码整体架构可参考官方文档docs/ 安装依赖三步跑通前提Python 3.11、Node.js 16、已安装 uv。git clone https://gitcode.com/GitHub_Trending/me/MediaCrawler cd MediaCrawler uv pip install -r requirements.txt若不走默认的 CDP 模式连接本机 Chrome无需装驱动再执行uv run playwright install安装浏览器驱动。核心开关都在 config/base_config.py每个平台另有独立文件如 config/xhs_config.py。 第一次采集怎么配置以抓某关键词的小红书笔记为例PLATFORM xhsKEYWORDS填英文逗号分隔的关键词LOGIN_TYPE qrcode。登录态目录由USER_DATA_DIR决定扫码一次后SAVE_LOGIN_STATE会将其缓存。数量与节奏CRAWLER_MAX_NOTES_COUNT控制帖子条数CRAWLER_MAX_SLEEP_SEC控制间隔默认 2 秒代理默认关闭需要时在 proxy/ 配置ENABLE_IP_PROXY与代理提供方。ENABLE_GET_SUB_COMMENTS True才会抓二级评论。SAVE_DATA_OPTION决定落盘格式结果写入项目data/目录。执行uv run main.py --platform xhs --lt qrcode --type search浏览器弹出后扫码确认随后开始抓取数据文件落在data/xhs/note/与data/xhs/comment/。把--type换成detail即按 ID 列表抓帖creator抓创作者主页。 平台差异速览平台可采集内容注意事项xhs 小红书笔记正文/图片/视频、一二级评论风控最严建议 CDP 模式并配代理dy 抖音视频元数据、互动数、评论扫码后可能触发手机验证ks 快手视频信息、评论GraphQL 接口依赖签名勿频繁改请求bili B 站视频数据、弹幕、评论需 B 站登录态wb 微博帖子、评论关键词搜索对登录态敏感tieba 贴吧帖子、评论回复以接口为主无需浏览器zhihu 知乎问答、文章、评论风控严建议低速各平台客户端源码见 media_platform/字段定义在各平台field.py中。️ 数据怎么落盘文件jsonl/json保留原始结构csv/excel便于直接打开分析SAVE_DATA_PATH可改输出目录。数据库sqlite/mysql/postgres自动建表并支持去重适合需要反复查询的场景模型见 database/models.py。 高频问题自查现象可能原因处理动作扫码后登录失败无头模式无法过滑块HEADLESS False人工过验证抓不到数据登录态过期删除对应*_user_data_dir目录重新扫码频繁风控/封禁请求过快、IP 单一调大CRAWLER_MAX_SLEEP_SEC开启ENABLE_IP_PROXY启动报 no such table未初始化数据库uv run main.py --db sqlite或改回文件落盘找不到结果文件未开启对应存储检查SAVE_DATA_OPTION与SAVE_DATA_PATH只有帖子没有评论评论抓取被关确认ENABLE_GET_COMMENTS True⚖️ 适合谁、不适合谁适合不适合有本机 Chrome、能扫码登录纯无头服务器无浏览器环境低频采集公开内容做调研大规模高频采集协议限定非商业学习用途想读源码做二次开发想要开箱即用的托管服务仓库另有一个商业项目 MediaCrawlerPro提供断点续爬、多账号管理并移除 Playwright 依赖与本文开源版是两套代码此处不做展开。MediaCrawler 的价值在于用登录态换掉了 JS 逆向的成本把采集门槛降到改配置加跑命令。文档见 docs/配置见 config/各平台源码见 media_platform/。【免费下载链接】MediaCrawler小红书笔记 | 评论爬虫、抖音视频 | 评论爬虫、快手视频 | 评论爬虫、B 站视频 评论爬虫、微博帖子 评论爬虫、百度贴吧帖子 百度贴吧评论回复爬虫 | 知乎问答文章评论爬虫项目地址: https://gitcode.com/GitHub_Trending/me/MediaCrawler创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考