
一条命令把5.5万首唐诗拉进本地古诗词数据库chinese-poetry使用指南【免费下载链接】chinese-poetryThe most comprehensive database of Chinese poetry 最全中华古诗词数据库, 唐宋两朝近一万四千古诗人, 接近5.5万首唐诗加26万宋诗. 两宋时期1564位词人21050首词。项目地址: https://gitcode.com/gh_mirrors/ch/chinese-poetry一条 git clone整个古诗词数据库就是你的chinese-poetry 收录了唐宋近1.4万位诗人、约5.5万首唐诗、26万首宋诗以及两宋1564位词人的21050首词全部以 JSON 格式打包。备课、写文案、训练模型写诗这份语料都够你吃很久。数据里装了什么先看看唐诗json数据长什么样不急着上代码先翻一翻文件。打开 poet.tang.0.json它是一个数组每首诗一个元素固定四个字段author作者名比如「太宗皇帝」title题目比如「帝京篇十首 一」paragraphs诗句正文按行拆成字符串数组「秦川雄帝宅函谷壯皇居」这样一句一行id每首诗的唯一编号。全唐诗按每千首拆成了从 0 到 57000 编号的文件另有唐诗三百首、唐诗补录这类精选集宋诗则是同构的 poet.song 系列。结构统一后面批量加载才轻松。三步用起来如何克隆古诗词数据集第一步把仓库拉下来。这是全文唯一一条命令git clone https://gitcode.com/gh_mirrors/ch/chinese-poetry第二步用文本编辑器随便翻翻。挑一个 poet.tang 文件打开纯中文文本直接就能读不挑工具。第三步让代码替你读。仓库自带 loader/data_loader.py里面的 PlainDataLoader 会读 datas.json 配置把tangsong、songci这类数据集名字映射到对应目录一次抽出全部诗句正文body_extractor也可以按名字组合多份语料extract_from_multiple。想把这套唐诗宋词数据整理成训练集直接复用就行。三件值得做的事教学备课找素材。讲唐诗单元按作者或主题从 JSON 里筛几十首出来课件素材就齐了唐诗三百首单文件就能撑住一个学期。写文案押歌词找灵感。卡在一个句子上的时候拿关键词在数据里一搜26万首宋诗摆在那儿总有人比你说得更好。喂给大模型做风格化创作。把 data_loader 输出的正文丢给大模型训练AI写诗只差一条提示词的事想再进一步拿这份语料微调一个专用模型也可以。榜单怎么读两张图看懂唐诗的语言特色仓库里还备好了统计图。第一张是唐诗高频词字号越大出现频率越高。「月」「春风」「千里」「万里」「行」这些词几乎包办了唐诗的情绪词汇你写诗或训模型都得让它们先用会这批意象。第二张是唐代诗人作品分布杜甫、李白、王维的名字明显比同辈大说明传世作品存得最多往下一层是元稹、张籍、韩愈。两张图对照着看唐诗的语言特色和创作格局你就有底了。从诗经、论语到四书五经仓库里还有些别的家底完整清单见 README.md。克隆下来跑一遍 loader这份古诗词数据库就能直接开工。【免费下载链接】chinese-poetryThe most comprehensive database of Chinese poetry 最全中华古诗词数据库, 唐宋两朝近一万四千古诗人, 接近5.5万首唐诗加26万宋诗. 两宋时期1564位词人21050首词。项目地址: https://gitcode.com/gh_mirrors/ch/chinese-poetry创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考