尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

如何在 3 分钟内用浏览器控制台完成 TikTok 评论批量采集与导出

如何在 3 分钟内用浏览器控制台完成 TikTok 评论批量采集与导出 如何在 3 分钟内用浏览器控制台完成 TikTok 评论批量采集与导出【免费下载链接】TikTokCommentScraper项目地址: https://gitcode.com/gh_mirrors/ti/TikTokCommentScraper想统计一个视频下的所有评论手动滚动、复制、粘贴几十条还能忍上千条时只会让人想砸键盘。回复里还套着回复层级一乱Excel 就成了一团浆糊。TikTokCommentScraper 就是为这个痛点而生的开源评论采集工具无需爬虫经验一个浏览器控制台加一个 Python 脚本就能把 TikTok 评论批量导出为结构化的 Excel 文件。它解决的是三个具体问题评论加载不全、回复层级丢失、导出格式杂乱。接下来我会以第一次接触 → 跑通 → 踩坑 → 熟练的旅程带你走完全程。当复制评论成为一天中最耗时的任务你大概也遇到过这样的场景为了统计抽奖名单或用户反馈打开评论区从头滑到尾。评论数少还好一旦上了几百上千条手酸眼累不说复制的文本还带着换行和表情符号贴进表格后又得手工清洗一遍。更隐蔽的坑是回复嵌套。TikTok 的评论区是两级结构一级评论下面挂着多条回复。手动复制时这些回复和父评论的从属关系几乎无法保留后期分析时根本分不清谁回复了谁。TikTokCommentScraper 把这一切变成了自动化流水线你只需要做复制、粘贴、再粘贴三个动作。认识 TikTokCommentScraper它把一件苦差拆成了两段活整个采集链路只有两个环节职责划分非常清晰阶段承担者干什么浏览器端采集src/ScrapeTikTokComments.js模拟真人滚动加载全部评论展开所有回复拼成 CSV 放入剪贴板电脑端转换src/ScrapeTikTokComments.py读取剪贴板 CSV清洗后写入 Excel输出带时间戳的 .xlsx与传统爬虫不同它不做任何网络请求也不伪装 User-Agent只是借用浏览器开发者控制台执行一段脚本。TikTok 看到的是一个真实用户在下滑页面反爬检测的触发概率因此大大降低——这是它最核心的差异化设计。它的能力可以浓缩成一张表能力具体表现全量评论加载自动滚动直到没有新评论内置连续无新增 N 次即停止的判定二级回复展开自动点击所有 View / Read more 按钮不放过任何回复层级关系还原明确标记一级评论 / 二级回复并记录回复对象结构化导出11 个字段加视频元信息直接可用于透视表分析Windows 开箱即用仓库内置精简版 Python 环境约 7MB双击 .cmd 即可开工前的 5 分钟环境检查与安装先确认两件事你有 Chromium 内核浏览器Chrome、Edge、Brave 均可你的系统满足下表其一。平台需要的环境准备动作Windows无需安装 Python仓库自带 python38 精简环境双击 .cmd 即可运行Linux / macOSPython 3 pip执行pip install -r requirements.txt仅 pyperclip 与 openpyxl 两个包Linux/macOS 用户获取项目git clone https://gitcode.com/gh_mirrors/ti/TikTokCommentScraper cd TikTokCommentScraper pip install -r requirements.txt依赖极简到只有两行requirements.txt里就是全部pyperclip负责读写系统剪贴板openpyxl负责生成 Excel 文件。没有数据库、没有浏览器驱动、没有虚拟化这也是它能做到五分钟上手的原因。 第一次实战三步拿到第一个 Excel 评论文件整个采集过程浓缩为三个动作全程约 3 分钟。第一步让脚本进剪贴板。打开目标 TikTok 视频页确认评论区可以手动滚动说明页面结构已完整加载。按 F12 打开开发者控制台切到 Console 标签。Windows 用户双击根目录的Copy JavaScript for Developer Console.cmd其他系统运行python src/CopyJavascript.py。辅助脚本会把src/ScrapeTikTokComments.js的完整内容复制到剪贴板。第二步在控制台执行。回到浏览器把剪贴板内容粘贴进 Console 并回车。这时你会看到三阶段自动运行先是滚动拉取一级评论然后逐个点击展开回复最后把所有数据拼成 CSV 写回剪贴板。控制台出现CSV copied to clipboard!即代表完成。第三步转成 Excel。注意从此刻起到转换结束不要复制任何其他内容。Windows 用户双击Extract Comments from Clipboard.cmd其他系统运行python src/ScrapeTikTokComments.py。几秒后项目根目录就会出现Comments_时间戳.xlsx用 Excel 或 LibreOffice Calc 打开即可查看。安全提醒把代码粘贴进控制台属于高风险操作。本项目的 JS 不发起任何网络请求剪贴板是唯一的敏感操作但任何陌生人给你的控制台代码都请先通读一遍再执行这是底线习惯。 拆开黑盒两段核心代码如何各司其职先看浏览器端最关键的滚动加载逻辑。它不关心 TikTok 的接口长什么样只做一件事把最后一个评论滚进视野逼出下一批数据。var buffer 30; // 允许连续无新评论的次数网速慢时可调大 var before getAllComments().length; // 滚动前的评论数量 while (buffer 0) { var comments getAllComments(); // 让最后一条评论进入视野模拟真人下滑触发懒加载 comments[comments.length - 1].scrollIntoView(false); await new Promise(r setTimeout(r, 300)); // 等 0.3 秒 var after getAllComments().length; if (after ! before) { buffer 15; // 有新评论重置计数 } else { buffer--; // 连续无新增计数器递减直至结束 } before after; }代码里的getAllComments()使用的是 XPath 定位——一种按元素路径查找 DOM 节点的写法。例如//div[contains(class, DivCommentContentContainer)]专门匹配评论容器。用 XPath 而不是常规选择器是因为 TikTok 前端存在大量同名 class精确路径更可靠。再看电脑端的数据转换脚本它做了四件事取剪贴板、洗数据、写 Excel、删中间文件。from csv import reader from os import remove, path from datetime import datetime as d from pyperclip import paste from openpyxl import Workbook cur_dir path.dirname(path.abspath(__file__)) csv_path path.join(cur_dir, .., Comments.csv) csv paste() # ① 取出剪贴板里的 CSV 文本 # ② 先落盘为 Comments.csv并统一换行符去掉 \r open(csv_path, w, encodingutf-8).write(csv.replace(\r, \n)) wb Workbook() ws wb.active with open(csv_path, r, encodingutf-8) as f: for row in reader(f): # ③ 标准 CSV 解析逐行写入工作表 ws.append(row) # ④ 导出带时间戳的 Excel并清理中间文件 wb.save(path.join(cur_dir, .., fComments_{d.timestamp(d.now())}.xlsx)) remove(csv_path)用 UTF-8 编码读写是保证中文评论不乱码的关键先存 CSV 再转 XLSX的中间步骤则让你在解析出错时能拿到中间文件排查。 你会拿到什么输出文件的字段与格式解读生成的 Excel 顶部是一段视频元信息抓取时间、视频链接、作者昵称与主页、发布时间、视频点赞/分享数、简介以及实际抓到的评论数 vs TikTok 显示总数及两者差值——这个差值能帮你判断数据是否抓全。下方是逐条评论表共 11 列字段含义Comment Number (ID)评论序号Nickname用户昵称User 用户唯一标识User URL用户主页链接Comment Text评论正文Time发布时间DD-MM-YYYYLikes点赞数Profile Picture URL头像图片链接Is 2nd Level Comment是否为二级回复User Replied To回复对象的昵称Number of Replies该一级评论下的回复数有了层级和回复数两列你在 Excel 里用筛选和透视表就能完整还原出对话树而不是一份平铺的文本列表。新手最容易踩的 3 个坑附解法坑 1等了很久评论数量却不再增长。原因网络较慢或连续无新评论的判定阈值提前触发滚动循环过早退出。解法把 JS 里的buffer初始值从 30 调大等待时间300改为 500~1000 毫秒若仍卡住手动滚动页面几秒再重新执行。坑 2双击转换脚本后没有生成 Excel。原因最常见的是执行 JS 后你复制了别的文本剪贴板里已不是 CSV或当前系统剪贴板机制不可用。解法重新执行浏览器脚本转换前不再复制任何内容若剪贴板异常脚本会提示手动粘贴 CSV粘贴后以空行结束输入即可。坑 3Excel 里中文显示为乱码。原因文件被非 UTF-8 方式读取。解法转换脚本默认以 UTF-8 写入一般不会出现若用其他工具二次处理请在 Excel 使用数据 → 从文本/CSV导入并显式选择 UTF-8 编码。另外提醒一点TikTok 显示的评论总数往往与实际可加载数不一致社区测试中约 2% 的评论可能永远加载不出来这是平台侧限制而非工具缺陷——表头里的Difference列正是为对齐这个差异而设计的。它能用在哪些地方三种角色的打开方式内容创作者做抽奖、投票或征稿时经常要统计参与名单。用本工具导出一份带昵称、主页链接和评论序号的清单配合 Excel 的 COUNTIF 与去重功能即可完成参与统计不用再逐条翻评论。市场与运营人员采集竞品视频评论可以对比不同作品的回复数 / 点赞数结构观察用户真实反馈输出文件中的时间列还能用来分析互动高峰时段辅助内容排期。研究者和数据分析师可以把它当作语料采集器评论正文、层级关系、互动数据一次拿全后续接入 pandas 做情感分析、词频统计或社交网络分析都非常顺手。最后的话从会用走向用好给你三个进阶建议一是先拿评论少于 200 的视频练手熟悉完整流程再上大场二是超过 3000 条评论的视频建议分段采集避免浏览器卡顿三是注意合规只采集公开内容尊重用户隐私并遵守平台条款。工具的价值从来不在脚本本身而在你拿到数据之后的分析与判断。现在就可以打开一个视频花 3 分钟跑通你的第一次采集——评论区里那个被忽略的信息世界正在等着你。核心资料清单浏览器采集脚本滚动加载、回复展开、CSV 生成src/ScrapeTikTokComments.js数据处理脚本剪贴板 → Excelsrc/ScrapeTikTokComments.py剪贴板辅助脚本把 JS 复制到剪贴板src/CopyJavascript.pyWindows 一键入口Copy JavaScript for Developer Console.cmd与Extract Comments from Clipboard.cmd依赖清单requirements.txt【免费下载链接】TikTokCommentScraper项目地址: https://gitcode.com/gh_mirrors/ti/TikTokCommentScraper创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表