
MediaCrawler 权限控制4 个环节的爬虫安全配置清单【免费下载链接】MediaCrawler小红书笔记 | 评论爬虫、抖音视频 | 评论爬虫、快手视频 | 评论爬虫、B 站视频 评论爬虫、微博帖子 评论爬虫、百度贴吧帖子 百度贴吧评论回复爬虫 | 知乎问答文章评论爬虫项目地址: https://gitcode.com/GitHub_Trending/me/MediaCrawlerMediaCrawler 支持小红书、抖音、快手、B 站等平台的内容与评论采集MediaCrawler 权限控制要解决的核心问题只有一个取数时不触发风控、不越界。下文按身份、出口、节奏、范围四个维度给出参数位置与取值照着改即可。拆解 MediaCrawler 权限控制的四个维度身份取数时用的凭证——哪个账号、登录态是否有效、浏览器环境像不像真人出口请求走哪条网络线——本机 IP 直连还是走代理节奏请求打得多快——间隔秒数、并行任务数范围拿多少数据——爬什么类型、一次最多爬几条这四项就是 MediaCrawler 权限控制的全部抓手开关集中在一个文件config/base_config.py。逐环节配置登录、代理、节奏、范围选对 MediaCrawler 登录方式LOGIN_TYPE 支持 qrcode、phone、cookie 三种默认走二维码手机号登录依赖安卓短信转发链路折腾成本最高新手建议避开。SAVE_LOGIN_STATE 为 True 时登录态会写入 brower_data/ 目录下次启动免扫码。# config/base_config.py LOGIN_TYPE qrcode # qrcode / phone / cookie SAVE_LOGIN_STATE True # 保持登录态 HEADLESS False # 出现滑块验证时可手动操作MediaCrawler 代理配置把出口藏起来默认是本机出口直连。开启 ENABLE_IP_PROXY 后请求改走代理池IP_PROXY_PROVIDER_NAME 选提供商、IP_PROXY_POOL_COUNT 定池子大小选 static 时可用家庭宽带或已购的固定代理。# config/base_config.py ENABLE_IP_PROXY True IP_PROXY_PROVIDER_NAME static # kuaidaili / wandouhttp / static IP_PROXY_POOL_COUNT 2 STATIC_PROXY_URL http://user:passhost:port各家提供商的参数比如快代理的密钥在 docs/代理使用.md 里逐项讲了。MediaCrawler 代理IP 使用流程图控制请求节奏下面两个参数决定爬虫有多温和保持默认值最稳只有在平台响应明显变慢时才考虑调小间隔而不是调大并发。# config/base_config.py CRAWLER_MAX_SLEEP_SEC 2 # 请求间隔秒 MAX_CONCURRENCY_NUM 1 # 并发任务数圈定数据范围CRAWLER_TYPE 决定取数方式search 是关键词搜索、detail 是帖子详情、creator 是创作者主页CRAWLER_MAX_NOTES_COUNT 限定单次帖子数上限。# config/base_config.py CRAWLER_TYPE search # search | detail | creator CRAWLER_MAX_NOTES_COUNT 15 # 单次爬取上限 配置动线改哪个文件、验证什么只改一个文件config/base_config.py。顺序建议先定 PLATFORM 和 LOGIN_TYPE再动 ENABLE_IP_PROXY 一组参数要开代理时最后微调节奏与范围组。验证分三步对应三个维度登录执行python main.py --platform xhs成功后生成 brower_data/ 目录下次启动不再扫码出口开启代理后到提供商面板看流量或用 IP 查询站确认出口已不是本机线路范围跑完后核对输出条数与 CRAWLER_MAX_NOTES_COUNT 是否一致不一致就停排错清单登录失效、代理不通、账号受限按现象 → 原因 → 处理排好序小红书扫码后一直滑块 → 虚拟浏览器指纹被识别 → 开启 CDP 模式连接你自己的真实浏览器参考 docs/CDP模式使用指南.md仍失败就删掉 brower_data/ 重新登录Cannot connect to existing browser on port 9222→ Chrome 未开远程调试或版本低于 144 → 在chrome://inspect/#remote-debugging勾选允许远程调试代理不通、请求超时 → 提供商参数没填对或出口无网络 → 先切 static 验证出口链路再切回提供商见 docs/代理使用.md刚能跑、过一阵就失效 → 账号触发平台风控 → 停止爬取删除 brower_data/ 换号或更换代理出口playwright Timeout 30000ms exceeded→ 网络层问题 → 检查本地网络与代理设置更全的症状对照在 docs/常见问题.md。划定爬虫合规边界红线与参数约束许可协议是 NON-COMMERCIAL LEARNING LICENSE 1.1见 config/base_config.py 头部注释与根目录 LICENSE仅学习与研究用途不得商用遵守目标平台条款与 robots.txt不得大规模爬取干扰平台运营。参数级约束单次帖子数CRAWLER_MAX_NOTES_COUNT 默认 15不建议上调请求间隔CRAWLER_MAX_SLEEP_SEC 保持 2 秒以上并发MAX_CONCURRENCY_NUM 1DISABLE_SSL_VERIFY 只用于 Burp 等中间人代理的调试场景生产环境别开源码注释已写明风险账号受限时的处理顺序固定停 → 换号 → 换出口不要靠加大并发或去掉间隔硬扛。把 MediaCrawler 权限控制的四个维度都调到保守值之后这套机制才算真正生效参数全部集中在一个文件改完跑一次就能验证。本文掌握清单能指出身份、出口、节奏、范围分别由哪个参数、在哪个文件里管会启用 static 代理并验证出口已切换记住账号受限的处理路径停、换号、换出口【免费下载链接】MediaCrawler小红书笔记 | 评论爬虫、抖音视频 | 评论爬虫、快手视频 | 评论爬虫、B 站视频 评论爬虫、微博帖子 评论爬虫、百度贴吧帖子 百度贴吧评论回复爬虫 | 知乎问答文章评论爬虫项目地址: https://gitcode.com/GitHub_Trending/me/MediaCrawler创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考