尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

小说下载器完全指南:10 分钟把整本网文存成 TXT 和 EPUB

小说下载器完全指南:10 分钟把整本网文存成 TXT 和 EPUB 小说下载器完全指南10 分钟把整本网文存成 TXT 和 EPUB【免费下载链接】novel-downloader一个可扩展的通用型小说下载器。项目地址: https://gitcode.com/gh_mirrors/no/novel-downloader你追更的小说突然提示该章节已删除付费订阅过的作品也能毫无征兆地从网站上消失。novel-downloader小说下载器就是为解决这个问题而生的工具它运行在浏览器里支持一百多个小说网站能把整本书的正文和插图批量抓取下来一键打包成 TXT 和 EPUB 文件存进你的硬盘。上图是小说下载器解析完书籍页面后的效果封面、简介、分卷章节列表一目了然确认列表完整后再开始下载心里就有底了。先弄清它是什么不是软件是一段脚本小说下载器不是要安装的桌面软件而是一个油猴脚本UserScript直接运行在网页里的浏览器脚本。你打开受支持的网站它就在页面右上角挂出一个下载图标点一下就开始干活。为什么用脚本而不是独立软件看这张对比对比项小说下载器浏览器脚本独立抓取软件安装浏览器装个脚本管理器即可要下载并运行安装程序登录状态直接沿用你浏览器的登录态往往要单独搬运 Cookie付费章节网站登录且已购买即可下载通常只能拿到公开内容跨平台跟着浏览器走Win/Mac/Linux 通用每个平台单独维护简单说你在网站上的身份是什么下载时就是什么基本不用额外配置账号。下载前先确认你的网站在支持名单里吗支持列表横跨国内外部分代表站点如下类型代表站点国内原创平台起点、晋江、番茄、七猫、纵横创作社区Lofter、pixiv、书耽日本平台小説家になろう、カクヨム、ハーメルン免费转载站笔趣阁系列、UU 看书、轻小说文库完整列表见仓库 README.md。你的站点在名单里就继续往下装不在的话也可以参考 src/rules/ 里的同类模板贡献一条新规则后文会说怎么做。十分钟完成安装下载第一本书第一步给浏览器装脚本管理器油猴脚本只是几行配置加一个 .js 文件没有运行环境跑不起来这个环境就是脚本管理器三选一Tampermonkey功能最全新手首选、Violentmonkey开源轻量、GreasemonkeyFirefox 经典款。装好后浏览器工具栏会多出一个图标这一步就完成了。第二步把小说下载器装进浏览器习惯自己构建的话克隆仓库编译出成品脚本git clone https://gitcode.com/gh_mirrors/no/novel-downloader cd novel-downloader yarn install yarn build构建完成后会得到dist/bundle.user.js把它拖进脚本管理器界面按提示确认安装权限弹窗直接允许。装好脚本后接下来就差找到那本书了。第三步打开目录页点右上角下载图标打开任意支持站点的书籍目录页右上角会出现下载图标。点下它右下角弹出进度条显示进度按 F12 能在控制台看到实时日志全部结束后浏览器自动下载一个 TXT 和一个 EPUB。 下载期间脚本会播放一段无声音频目的是阻止浏览器把后台标签页休眠属于正常现象。上图是一次真实下载的进行时画面控制台逐条打印每个章节的请求记录任务栏能看到脚本已经产出的 ZIP 和 TXT 文件全程无需人工干预。点击按钮之后后台四步流水线你只点了一次按钮脚本内部其实跑完了四步解析目录从目录页读出章节链接连同书名、作者、分卷整理成结构化清单抓取章节逐个请求章节正文未购买或未登录的付费章节自动跳过清洗内容去掉广告和导航只留正文段落与插图逻辑在 src/lib/cleanDOM.ts打包输出按模板生成 TXT 和 EPUB插图一并嵌入流式写出。每个网站的页面结构不同所以怎么取章节链接、怎么取正文这一对核心逻辑按网站各有一份规则全部放在 src/rules/ 下想贡献新站点继承BaseRuleClass实现这两个方法再到 src/router/download.ts 登记域名即可。网站把文字藏进图片时三层解码救场有些站点比如西瓜书屋会把正文文字直接替换成图片让抓取工具只拿到一堆图。小说下载器按先快后准的顺序处理文件名映射按图片文件名直接查表匹配文字最快哈希匹配下载图片计算哈希值与映射表比对内容相同即可命中OCR 识别调用 PaddleOCR 中文模型逐字识别最慢但准确度最高。匹配表会自动拉取并缓存在脚本管理器的本地存储里OCR 模型首次使用才下载。三层都失败的文字会被忽略遇到这类站点建议用 HTML 版成品核对一遍。上图是一个图文混排章节的保存效果文字段落和插图都完整保留阅读体验和原站一致。另一类常见手段是字体加密正文用自定义字体渲染直接抓取全是乱码。脚本会自动下载字体并建立字符映射来还原晋江文学城、番茄小说可能需要你手动配合一次匹配留意控制台里以[jjwxc-font]、[fanqie-font]开头的提示即可。三个真正好用的进阶开关进阶用法思路一致按 F12 打开控制台在点下载按钮之前粘贴代码。只下载部分章节。比如只存前 50 章function chapterFilter(chapter) { return chapter.chapterNumber 50; }意思是只有满足条件的章节才进入下载队列其余全部跳过想只下某一卷把条件换成chapter.sectionNumber 1就行。改输出样式。比如统一章节标题为第 N 章 XXX格式const saveOptions { getchapterName: (c) 第${c.chapterNumber}章 ${c.chapterName ?? }, }; window.saveOptions saveOptions;人话每个章节标题都按你写的函数重新生成首行缩进、行距这类排版也能通过mainStyleText注入一段 CSS 来调整。下载完自动收尾。比如下完自动关闭标签页function customFinishCallback() { window.close(); }文件生成完毕后这个函数自动执行适合批量挂机时省掉手动关页。⚠️ 以上自定义变量都必须在点击下载按钮之前注入否则脚本读取不到配置不会生效。下载不顺对照这张表现象常见原因解决办法右上角没有下载图标单页应用页面没初始化完按 F5 强制刷新当前页付费章节全部跳过未登录或未购买登录网站账号并确认已购买下载速度太慢网站反爬限速设置里开自定义下载设置降线程数、拉大间隔文档出现乱码字符字体加密匹配未完成按控制台[jjwxc-font]/[fanqie-font]提示提交匹配图片文字变空白三层解码均失败改用 HTML 版成品查看长时间无进展网络波动或页面休眠标签页保持前台等待自动重试排查不出原因就开调试模式在设置里开启后下载包里会附带debug.log把完整日志提交给开发者能大幅提高定位效率如果压根没产出文件可在设置里启用测试视图复制日志选项卡的内容另行保存。上图是一本下载完成的 TXT 成品书名、分卷、章节层层分明任何文本编辑器或阅读软件都能直接打开。回到开头那个 404网站会消失你的硬盘不会。趁作品还在线打开目录页点一下右上角的图标把整本书变成随时可读的 TXT 和 EPUB——下次再遇到心动的那本别再只收藏链接了。【免费下载链接】novel-downloader一个可扩展的通用型小说下载器。项目地址: https://gitcode.com/gh_mirrors/no/novel-downloader创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表