尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

MediaCrawler 多平台爬虫教程:5 分钟跑通小红书、抖音等 7 个站点

MediaCrawler 多平台爬虫教程:5 分钟跑通小红书、抖音等 7 个站点 MediaCrawler 多平台爬虫教程5 分钟跑通小红书、抖音等 7 个站点【免费下载链接】MediaCrawler小红书笔记 | 评论爬虫、抖音视频 | 评论爬虫、快手视频 | 评论爬虫、B 站视频 评论爬虫、微博帖子 评论爬虫、百度贴吧帖子 百度贴吧评论回复爬虫 | 知乎问答文章评论爬虫项目地址: https://gitcode.com/GitHub_Trending/me/MediaCrawlerMediaCrawler 是一款开源多平台自媒体数据采集工具覆盖小红书、抖音、快手、B站、微博、贴吧、知乎 7 个主流平台能抓取笔记、视频和评论数据靠浏览器登录态代替复杂的 JS 逆向新手也能直接上手。 最短路径上手五分钟跑通第一次采集先备好 Python建议 3.11和 Node.js 16 以上Node 是抖音、知乎的签名脚本用的。默认 CDP 模式直接复用你本地的 Chrome不用额外装浏览器驱动。三步跑起来git clone https://gitcode.com/GitHub_Trending/me/MediaCrawler cd MediaCrawler uv sync uv run main.py --platform xhs --lt qrcode --type search最后一条命令会打开 Chrome 让你扫码登录小红书然后开始按关键词抓取。登录态会缓存下次运行免扫码。不喜欢命令行的话也可以启动 WebUI 可视化界面在浏览器里改参数、看实时日志 核心玩法三种模式覆盖所有取数任务不管你要做什么都能落到下面三种模式里。参数可以先写进配置文件再靠命令行参数覆盖。按关键词搜索输词拿内容加评论最常用的模式。指定--type search和关键词多个用英文逗号分隔会自动抓笔记或视频的正文、互动数据以及一级评论uv run main.py --platform dy --lt qrcode --type search --keywords 咖啡,探店用--max_comments_count_singlenotes限制单条内容的评论抓取量大热评论容易拖慢整体速度所以先控量再放量。按内容ID批量抓取怎么做手里有具体链接时用--type detail加--specified_id支持完整 URL多个 ID 逗号分隔uv run main.py --platform bili --type detail --specified_id BV1xx411c7mD,BV1xx411c7mE适合批量分析几条明确的竞品内容或历史爆款不会有搜索带来的偏差。盯住某个主页跟踪一个账号用--type creator传入创作者主页 URL 或 ID即可抓取该账号发布的内容和互动数据uv run main.py --platform xhs --type creator --creator_id 你的创作者ID适合盯目标账号定期跑一遍就能观察更新频率和热度变化。 数据落盘一句话选存储格式默认存 JSONL 到 data 目录一行一条记录方便脚本后续读取。习惯 Excel 就加--save_data_option excel直接出报表。数据量大、要反复跑就选 sqlite 或 mongodb内置去重二次运行不会产生重复记录。 场景实战把数据变成真实工作场景一竞品营销监控背景想看竞品账号最近在做什么。做法--type search模式输入竞品品牌名开启评论抓取每周跑一次。拿到什么新发内容清单、互动数据以及用户评论里的真实反馈。场景二产品口碑词云背景想知道用户对某产品说了什么。做法按产品名搜索抓评论配置文件里把ENABLE_GET_COMMENTS和ENABLE_GET_WORDCLOUD都设为 True数据需存为 json 或 jsonl。拿到什么用户反馈的高频词分布图停用词可在 hit_stopwords.txt 里过滤。️ 避坑指南三个最常卡住的地方坑一小红书登录滑块一直过不了现象扫码成功但卡在滑块验证。原因小红书风控严格新开的浏览器容易被识别。解法保持默认 CDP 模式连接自己的真实 Chrome并删除项目根目录下 brower_data 目录后重新登录。坑二抖音、知乎报 SyntaxError: 缺少 ;现象命令行弹出 execjs 相关报错。原因没装 Node.js 环境。解法安装 Node.js 16 以上再重跑这是缺 Node 最直接的信号。坑三开始能爬过一段时间就失效现象没报错但拿不到新数据。原因账号登录态被平台风控失效。解法先降低抓取频率和数量删除 brower_data 换账号重新登录高频需求再上代理池。项目支持多种代理服务商并自动轮换 IP整体流程如下代理IP拉取入池与轮换的完整流程图服务商控制台里的代理账号密码就是需要配置进环境变量的凭据代码里通过环境变量读取密钥避免把账号密码硬编码进文件 最后说两句三种模式加一条命令就能开始采集任意平台的内容与评论。更多运行问题先看项目里的 docs/常见问题.md所有参数都能在 config/base_config.py 里改。【免费下载链接】MediaCrawler小红书笔记 | 评论爬虫、抖音视频 | 评论爬虫、快手视频 | 评论爬虫、B 站视频 评论爬虫、微博帖子 评论爬虫、百度贴吧帖子 百度贴吧评论回复爬虫 | 知乎问答文章评论爬虫项目地址: https://gitcode.com/GitHub_Trending/me/MediaCrawler创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表