[开源] 分享导出博客园文章成本地 Markdown 文件存储的工具
此文主要分享了如何将自己博客园的文章自动导出到 Markdown 文档进行存储以便在本地进行归档管理程序中也对文章的分类、tag、代码块以及文章中的图片进行了保存处理以便上传到自己的图。整理后的 Markdown 可以在本地整理成册或者发布到自己的个人博客上比如我使用 Markdown 书写的 个人博客 。文章目录支持的功能基本原理几个知识点将 HTML 转换成 Markdown注意 Mac 和 Windows 以及 Linux 下的换行的区别文章分类、tag 的获取文章中图片保存项目开源下载1. 支持的功能可以循环抓取自己博客园的所有文章导出到 Markdown 文件进行保存在 Markdown 的头部保存了原文章的标题、发表时间、文章分类、文章 tag 元素文章中的代码块会抽取出来包含在codeblock中你也可以修改源码保存成其他的格式块保存的文件名就是原文章的路径如果你的文章都设置了EntryName那生成的文件名就会非常的友好文章中的图片可选进行本地保存命名的格式为源文件名并可在原文中将链接进行图床前缀的替换你可以修改源码按照自己的格式进行保存。抓取保存后文件预览。2. 基本原理循环抓取博客的列表获取到文章的链接循环文章的链接进行抓取提取元素保存抓取到的元素进行格式化并保存。3. 几个知识点将 HTML 转换成 Markdown这里使用了一个开源的组件 Html2Markdown ,在控制台安装组件后就可以使用了主要支持两个方法。对字符串进行转换var html Something to strongconvert/strong; var converter new Converter(); var markdown converter.Convert(html);对文件进行转换var path file.html; var converter new Converter(); var markdown converter.ConvertFile(path);注意 Mac 和 Windows 以及 Linux 下的换行的区别具体的区别可以看这里可以根据自己的情况对源码进行修改。unix、windows、mac 的换行习惯unix / linux用 LF (\n) 表示一行结束。mac用 CR (\r) 表示一行结束。windows用 CR LF (\r\n) 和起来表示一行结束。文章分类、tag 的获取分析后发现通过模拟请求 API 获取即可需要的参数通过正则匹配获取返回数据为 Unicode 进行转码提取。文章中图片保存你可以修改源码开启或关闭此功能使用文章中文件名作为保存到本地的文件名并将文章中的图片前缀进行了替换你可以替换成你自己新的图床地址。输出的图片文件在程序启动的images文件夹。4. 项目开源下载项目源代码在 GitHub需要注意的问题是项目中可能因为新旧文章中某些格式的变化导致抓取出来的 Markdown 格式可能稍有偏差以及图片、代码块的处理你需要去根据自己的博客去进行对应的调整后使用。