尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

如何用MediaCrawler采齐7个平台的数据并全程可追溯

如何用MediaCrawler采齐7个平台的数据并全程可追溯 如何用MediaCrawler采齐7个平台的数据并全程可追溯【免费下载链接】MediaCrawler小红书笔记 | 评论爬虫、抖音视频 | 评论爬虫、快手视频 | 评论爬虫、B 站视频 评论爬虫、微博帖子 评论爬虫、百度贴吧帖子 百度贴吧评论回复爬虫 | 知乎问答文章评论爬虫项目地址: https://gitcode.com/GitHub_Trending/me/MediaCrawler多平台的数据为什么采不全、对不上MediaCrawler是一个面向多平台数据采集的开源爬虫框架。从小红书、抖音、B站分别拉数据常常拿到三种文件、三套字段对不上账。这篇文章按安装、首次采集、平台挑选、存储落地的顺序走一遍。三分钟跑通第一次采集开源爬虫框架最短路径前置条件装好 uv 和 Node.js ≥16.0.0抖音、知乎的签名脚本要跑在 Node 上。然后三条命令git clone https://gitcode.com/GitHub_Trending/me/MediaCrawler cd MediaCrawler uv sync uv run playwright install uv run main.py --platform xhs --lt qrcode --type search第二条装 Python 依赖和浏览器驱动第三条启动关键词搜索模式手机扫码后浏览器开始访问页面数据默认以 jsonl 落进 data/ 目录。不想碰命令行的话启动 api/ 服务后打开 WebUI日志窗口会实时滚动采集进度。参数都在 config/base_config.py 里KEYWORDS 填搜索词CRAWLER_MAX_NOTES_COUNT 控制采集量默认 15 条CRAWLER_TYPE 在 search、detail、creator 三种模式间切换。Playwright 爬虫、代理池与追踪ID全程追踪怎么做的链路靠三件事撑住。浏览器自动化MediaCrawler 走 Playwright 爬虫的路线——登录并保存登录态再在页面里执行 JS 表达式取签名参数不用逆向加密算法。base/base_crawler.py 定义爬虫、登录、存储、客户端四个抽象类7 个平台各填实现。代理池被限流时换出口 IP。proxy/proxy_ip_pool.py 从供应商接口拉 IP、逐个验证、存入 Redis请求失败就换下一个。内置 kuaidaili、wandouhttp、static自备静态代理三种来源。追踪 ID 与重试小红书签名会给每个请求生成 16 位随机 trace id请求链路事后能查客户端层失败会自动重试 3 次。![MediaCrawler代理IP池采集流程图](https://raw.gitcode.com/GitHub_Trending/me/MediaCrawler/raw/5665a271ef15e0ec82b1f48a951b66760e054db9/docs/static/images/代理IP 流程图.drawio.png?utm_sourcegitcode_repo_files)7个平台怎么挑一平台一句话7 个平台实现都在 media_platform/ 目录下挑选建议平台代号能拿到的数据一句话特点小红书xhs笔记、评论、词云签名与追踪ID最完整支持海外版抖音dy视频、评论、创作者签名依赖 Node 环境扫码可能出手机验证快手ks视频、评论走 GraphQL 接口B站bili视频、UP动态、评论支持词云生成微博wb帖子、评论唯一支持下载图片视频资源贴吧tieba帖子、二级回复有回复树知乎zhihu问答、文章、回答同样需要 Node 环境做小红书数据采集或抖音数据抓取就从前两行开始盯社区舆情看贴吧和微博。search、detail、creator 三种模式靠 --type 切换不用改代码。存储格式怎么选、数据长什么样SAVE_DATA_OPTION 有 8 个取值csv、json、jsonl、excel、sqlite、mysql、postgres、mongodb。默认 jsonl 逐行追加写入性能最好临时看数用 excel内容、评论、创作者 3 张表长期使用建议 sqlite靠唯一索引去重uv run main.py --init_db sqlite uv run main.py --platform xhs --lt qrcode --type search --save_data_option sqlite表结构定义在 database/models.py每个平台都是内容、评论、创作者 3 张表。值得留意的字段add_ts 与 last_modify_ts 记录首次采集和最后更新时间source_keyword 记下数据来自哪个关键词creator_hash 是创作者匿名哈希昵称做了脱敏这个教学版不落库任何可识别真实用户的字段。采集最常被问的3个坑登录态、限流、重复数据登录态失效SAVE_LOGIN_STATE 默认把浏览器目录持久化重跑不用重新扫码状态真坏了就删掉对应平台的 user_data_dir 目录再扫一次。小红书扫码弹滑块时配置默认非无头模式直接在浏览器里手动过掉。限流请求间隔默认 2 秒、并发 1别猛调并发量上来就开代理池ENABLE_IP_PROXYTrue让池子负责换 IP。重复数据文件类格式都是追加写同一关键词跑两遍就重复换 sqlite 或 mysql 直接解决——内容表对作品 ID 有唯一索引冲突时更新而不是再插一条。拿到数据之后先跑一个平台登录、采集、存储的管道已经铺好。挑一个最熟的先把 search 模式跑通翻一遍 data/ 里的 jsonl 确认字段再谈存储升级。【免费下载链接】MediaCrawler小红书笔记 | 评论爬虫、抖音视频 | 评论爬虫、快手视频 | 评论爬虫、B 站视频 评论爬虫、微博帖子 评论爬虫、百度贴吧帖子 百度贴吧评论回复爬虫 | 知乎问答文章评论爬虫项目地址: https://gitcode.com/GitHub_Trending/me/MediaCrawler创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表