
知网文献批量下载指南CNKI-download 三步跑通的爬虫工具【免费下载链接】CNKI-download:frog: 知网(CNKI)文献下载及文献速览爬虫 (Web Scraper for Extracting Data)项目地址: https://gitcode.com/gh_mirrors/cn/CNKI-downloadCNKI-download 是一个用 Python 写的知网文献下载爬虫。它能调用知网高级检索把检索结果里的元数据自动整理成 Excel还可以批量下载 CAJ 原文。适合需要一次性收集几十上百篇知网文献的研究生和科研人员把逐篇点开、复制、保存的重复劳动省掉。30秒看懂它干什么假设你要收集机器学习 医疗诊断方向的期刊文献用这个工具的流程是运行main.py在终端里选择主题字段输入检索词程序替你完成知网高级检索的两次握手请求返回结果并估算总耗时你确认数量后它自动翻页、逐篇写出简要信息开启详情模式后摘要、作者、单位、关键词、来源、发表时间被写进 Excel开启下载模式后CAJ 原文存进data/CAJs文件夹手动做的话一篇文献点开、复制、保存大约要 5 分钟这里只需要设置一次让它自己跑。 三步跑起来第 1 步装依赖git clone https://gitcode.com/gh_mirrors/cn/CNKI-download cd CNKI-download pip install -r requirements.txt如果系统没装 tesseract OCR 引擎先安装 tesseract 再执行 pip 命令或者把CrackVerifyCode.py中 tesserocr 相关两行注释掉反正默认走手动输入验证码。第 2 步改两处配置打开根目录的Config.ini新手只需要动两个值isDetailPage1 ; 开启详情存 Excel这是核心价值 stepWaitTime5 ; 每次操作间隔 5 秒防止被限流第 3 步运行python main.py程序按提示依次让你选检索字段、输入关键词、确认数量然后开始爬取。⚙️ 关键配置怎么选配置集中在 Config.ini 的[crawl]段全部是 0/1 开关加一个秒数。最常用的是这 5 个参数含义建议值为什么这么设isDownloadFile是否下载 CAJ 原文新手先设 0先拿信息、Excel 里筛完再下省流量也省时间isDetailPage是否把详情写入 Excel1摘要、作者、来源都在这里不导 Excel 就只剩标题列表isCrackCode是否自动识别验证码0OCR 识别率一般手动输入 100% 准确isDownLoadLink是否在 Excel 加一列下载链接1筛选出重点文献后可按链接单独下载stepWaitTime每次操作间隔秒数5最低 3间隔太短会触发远程主机拒绝了访问一条官方提醒值得记下载原文和抓详情页尽量不要同时开启请求量叠加最容易触发反爬。 跟做一次真实任务场景开题前收集机器学习 医疗诊断相关期刊文献 100 篇。配置设为isDownloadFile0、isDetailPage1、isDownLoadLink1、stepWaitTime5运行python main.py选择检索字段时输入a主题提示输入主题时填机器学习 医疗诊断是否规定文献来源输入n程序输出检索结果类似检索到1234条结果全部下载大约需要00小时16分55秒。 是否要全部下载y/n?输入n再输入100不满一页会按整页 20 篇处理运行中若弹出验证码程序会把图片存到data/crack_code.jpeg并提示输入照着打进去即可结束后查看data目录data/ ├── Links.txt # 每篇文献的下载链接 ├── ReferenceList.txt # 简要信息列表 └── Reference_detail.xls # 含摘要的详情表Excel 里按序号、题名、作者、单位、关键字、摘要、来源、发表时间、数据库、下载地址排好列直接用筛选功能挑出高相关文献或导入 EndNote、Zotero。⚠️ 踩坑与应对Q1报远程主机拒绝了访问把stepWaitTime从 5 调到 810给服务器留足响应时间。Q2验证码反复要求输入即使输对了只爬信息不下载时爬到 1000 条左右可能出现这个已知问题。对策是分批运行单次数量控制在几百条以内。Q3第二次运行报 data 文件夹无法删除程序每次启动会清空重建data目录先关掉里面所有已打开的文件尤其是 Excel再运行。Q4公网环境跑不通该工具假设你的 IP 能直接访问知网校园网或单位已购数据库的网络下最稳公网访问是 README 里列出的待完成项尚未实现。Q5pip 安装时 tesserocr 报错先装 tesseract 引擎再 pip install用不到 OCR 的话直接注释CrackVerifyCode.py里 tesserocr 的两行代码保留手动验证码模式。 边界与提醒这个工具适合个人学习和研究场景用它整理检索结果、筛选文献比手工快几个数量级但下载量请控制在合理范围遵守知网的版权条款不要用于商业分发。另外注意data目录每次运行会被清空需要保留的结果请及时拷出或备份。整体实现就是一个发请求包 正则解析的爬虫几个 Python 文件各自负责检索、验证码、详情解析想看细节直接读源码即可。【免费下载链接】CNKI-download:frog: 知网(CNKI)文献下载及文献速览爬虫 (Web Scraper for Extracting Data)项目地址: https://gitcode.com/gh_mirrors/cn/CNKI-download创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考