尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

XunziALLM:开源古籍大模型,让文言文翻译、自动标点与信息抽取更省事

XunziALLM:开源古籍大模型,让文言文翻译、自动标点与信息抽取更省事 XunziALLM开源古籍大模型让文言文翻译、自动标点与信息抽取更省事【免费下载链接】XunziALLM项目地址: https://gitcode.com/gh_mirrors/xu/XunziALLMXunziALLM 是面向中文古籍领域的开源大语言模型提供文言文自动标点、古今翻译、阅读理解、词性标注与古籍信息抽取能力适合古籍研究者、语言学学生和想接入古文处理能力的开发者。处理古籍时常见的麻烦古籍原文往往是一段没有标点、夹杂生僻字的连续文字。想用它做研究或做数字化加工通常要人工断句、逐句查词翻译再把文中的人物、地点、事件整理出来流程慢而且很难二次复用。XunziALLM 把这条链路变成了一组提示词把原文贴进去直接得到带标点的文本、现代汉语译文或实体列表。对要批量处理古籍资料的人来说省掉了大量重复性阅读和整理工作。为什么值得试 XunziALLM它的核心做法是古籍领域的继续预训练以 Qwen、ChatGLM3、Baichuan2 等开源模型为基座在中文语料和古籍语料上继续训练。模型覆盖 4B、7B、14B 等规格另提供对话版 XunziChat调用方式与对应开源模型保持一致用过 Qwen 或 ChatGLM 的话几乎没有迁移成本。它还同时开放了基座模型与对话模型简单任务直接用对话版特殊需求可以用本地语料自行微调。官方给出的能力演示包括古籍标引、信息抽取、诗歌生成、古文翻译、阅读理解、词法分析和自动标点每一项都能逐一验证效果。古籍大模型适合哪些人和场景如果你是古籍研究者或文献学学生可以用自动标点和分词词性标注能力快速处理原文直接用于精读与整理。如果你在做古籍数字化项目可以用信息抽取与标引能力自动梳理人物、地点、事件与主题。如果你是开发者想给应用加上古文理解能力可以用对话模型 API 快速接入搭出古籍问答或翻译功能。如果你关注古汉语方向的自然语言处理研究可以用基座模型配合项目内的样例数据做实验或微调。三分钟了解 XunziALLM 的接入方式先克隆仓库浏览 README依赖清单在 requirements.txt 中git clone https://gitcode.com/gh_mirrors/xu/XunziALLM接着用仓库内基于 modelscope 的下载脚本拉取模型本地运行 web/ 目录下的 streamlit 演示页就能在浏览器里体验翻译、标点等能力。如果只想快速体验效果、不本地跑模型项目开放了免费的对话 API用 openai 库即可调用client OpenAI(api_keyANY THING, base_urlhttp://xunziallm.njau.edu.cn:21180/v1)之后按普通聊天接口发消息就能拿到翻译、标点、抽取等任务的结果。下一步建议先跑一遍 web_demo.py 的对话演示摸清它的能力边界再决定是否接入自己的工作流。若某个任务效果不理想可以用基座模型加自有语料微调试试也可以把反馈提给团队README 中明确欢迎意见建议。【免费下载链接】XunziALLM项目地址: https://gitcode.com/gh_mirrors/xu/XunziALLM创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表