尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

1 条命令跑通 Instagram 数据爬取与粉丝统计

1 条命令跑通 Instagram 数据爬取与粉丝统计 1 条命令跑通 Instagram 数据爬取与粉丝统计【免费下载链接】instagram-profilecrawl quickly crawl the information (e.g. followers, tags etc...) of an instagram profile.项目地址: https://gitcode.com/gh_mirrors/inst/instagram-profilecrawl一条命令就能把目标账号的粉丝数、帖子文案、话题标签、点赞与评论量全部抓下来落成结构化文件。看完本文你会用instagram-profilecrawl完成三件事零登录的 Instagram 数据爬取、每日定时采集以及一份持续追加的粉丝统计报表stats.csv。它基于 Selenium 驱动真实浏览器访问公开页面无需账号即可开工Windows、macOS、Linux 通吃。用表格看懂输入与产出整个链路很直白命令行报上用户名工具驱动浏览器逐个访问把结构化结果写进磁盘。输入处理产出命令行传入一个或多个 Instagram 用户名Selenium 驱动浏览器访问资料页滚动加载帖子并解析字段profiles/{username}.json粉丝/关注/帖子数每篇帖子的文案、位置、图片、点赞、评论、标签上一步的 JSONlog_stats.py读取快照stats.csv追加一行时间序列数据profiles目录extract_image.py下载本地images/用户名/素材备份评论者名单会单独存为profiles/{username}_commenters.txt按评论次数排序。三步跑通第一次爬取默认配置直接开工全程只需三条命令。1. 装好依赖git clone https://gitcode.com/gh_mirrors/inst/instagram-profilecrawl cd instagram-profilecrawl pip install -r requirements.txt2. 放好浏览器驱动从 Chromedriver 官方站下载与本机 Chrome 版本匹配的驱动重命名为chromedriver放入项目assets目录脚本会自动加载。3. 运行爬取python3.7 crawl_profile.py instagram也支持一次传多个账号python3.7 crawl_profile.py user1 user2 user3。跑完后打开profiles/instagram.json粉丝数、关注数、帖子列表、标签全部就位。功能详解以下每个功能都对应一个真实场景按需取用即可。完成爬取规模与速度的调节控制变量集中在util/settings.py改完立即生效Settings.limit_amount 2000 # 最大帖子数默认 1000 Settings.sleep_time_between_post_scroll 14.5 # 帖子滚动间隔秒 Settings.sleep_time_between_comment_loading 1.5 # 评论加载间隔注意间隔过短容易触发平台风控弱网环境下建议直接加大。完成登录配置以抓取关注者默认零登录要访问已关注的私密账号或拉取关注者列表先建环境变量文件再打开对应开关cp .env.example .envSettings.scrape_follower True.env中填入IG_USERNAME与IG_PASSWORD。注意登录属敏感操作建议用小号并控制频率。完成树莓派无界面环境部署树莓派走 Firefox 加虚拟显示与桌面版的 Chrome 路线不同sudo apt-get install firefox-esr sudo pip3 install pyvirtualdisplay python3 crawl_profile_pi.py target_user记得按官方文档装好geckodriver入口脚本在quickstart_templates/crawl_profile_pi.py。完成帖子图片的批量备份JSON 里有图片链接想本地留存素材时python3.7 extract_image.py profiles图片统一落到images/用户名/目录。注意JSON 里没有帖子数据的账号会被跳过并提示。完成粉丝增长统计报表log_stats.py把 JSON 快照变成时间序列python3 log_stats.py -u target_user省略-u则统计profiles下全部账号。注意每个账号处理完会移入profiles/done避免重复计数。配置每日定时任务以监控竞品账号competitor_a为例凌晨 3 点抓取3:05 出报表3:20 备份素材。执行crontab -e追加如下任务0 3 * * * cd /data/web/disk1/git_repo/gh_mirrors/inst/instagram-profilecrawl python3 crawl_profile.py competitor_a crawl_log.txt 21 5 3 * * * cd /data/web/disk1/git_repo/gh_mirrors/inst/instagram-profilecrawl python3 log_stats.py -u competitor_a stats_log.txt 21 20 3 * * * cd /data/web/disk1/git_repo/gh_mirrors/inst/instagram-profilecrawl python3.7 extract_image.py profiles image_log.txt 21时间命令产出03:00python3 crawl_profile.py competitor_aprofiles/competitor_a*.json快照03:05python3 log_stats.py -u competitor_astats.csv追加一行增长数据03:20python3.7 extract_image.py profilesimages/competitor_a/素材备份连续跑一周后stats.csv就是现成的粉丝增长曲线数据源profiles目录则保留了每天的可复查快照。常见问题Q一启动就报 Chromedriver 相关异常通常是驱动缺失或与浏览器版本不匹配。重新下载匹配版本的驱动放入assets目录树莓派用户改用crawl_profile_pi.py并检查geckodriver是否就位。Q爬取中途卡死或长时间无响应多半是滚动间隔过短触发风控或弱网导致页面加载超时。把sleep_time_between_post_scroll从 14.5 调到 25 左右再试。Q登录后仍然抓不到关注者列表Settings.scrape_follower默认是False先把它设为True并确认登录账号已关注目标个别超大号上此功能偶尔会崩溃。Q树莓派上脚本跑不起来桌面版依赖 Chrome树莓派请换crawl_profile_pi.pyFirefox 加虚拟显示并装好 firefox-esr、geckodriver、pyvirtualdisplay。收尾与下一步从每天手动翻页抄数到一条命令加 crontab 的无人值守采集中间只差一次配置。连续的 JSON 快照与stats.csv就是你做内容策略和竞品监测的数据底座。下一步逐条读完util/settings.py里的开关按需开启评论、点赞用户等字段参考quickstart_templates/下的模板脚本在代码里定制自己的爬取逻辑把stats.csv接进你的报表工具或可视化脚本现在就去克隆仓库让第一次 Instagram 数据爬取在五分钟内跑完。【免费下载链接】instagram-profilecrawl quickly crawl the information (e.g. followers, tags etc...) of an instagram profile.项目地址: https://gitcode.com/gh_mirrors/inst/instagram-profilecrawl创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表