《大话文渊慧典》:三
《文渊慧典》开发手记之三国内外研究现状摘要本文系统梳理了全球古籍数字化的主要模式与国内现状。海外方面美国如哈佛燕京图书馆以硬件投入见长但中文OCR精度不足欧洲如Europeana强于标准化但中文资源边缘化日韩则各有精细或封闭的技术路线。国内则呈现国家队国图、高校北大、浙大等与民间开源力量并存的“星星之火”局面。面对差距项目团队提出“非对称作战”思路依托AI开源红利如PaddleOCR、聚焦中文古籍图像PDF细分场景、坚持开源与本地化部署旨在将前沿技术“拆成自行车配件”赋能基层图书馆补齐古籍图像到可检索知识的“最后一公里”。——大胖老师“小菜你知道哈佛燕京图书馆最让我羡慕的是什么吗”——小菜“是楼下的咖啡机听说免费续杯。”——大胖老师“……是他们的数字化率超过了80%。咱们呢8%还差个小数点。”一、先讲个鬼故事我们的古籍正在以“页”为单位消失2021年河南暴雨开封图书馆地下书库进水一批未数字化的明代方志泡成了纸浆。2022年西南某县档案馆因老鼠啃噬清代契约损毁过半。2023年一位退休老馆长去世他脑子里装着的某孤本索引体系也跟着烧成了灰。大胖老师每次提起这些事都猛灌一口枸杞水压惊。“数字化就是给古籍上保险。可这保险全世界都在买咱们还在纠结保费贵不贵。”他说完打开投影仪屏幕上出现一张世界地图上面标注着大大小小的古籍数字化项目。“今儿就带你出国考察看看别人家是怎么弄的再掂量掂量咱们的家底。”二、美国模式有钱任性硬件拉满但中文欠佳代表哈佛燕京图书馆Harvard-Yenching Library哈佛燕京东亚研究藏书的天花板中文古籍超过60万册。早在2000年初他们就启动了数字化用的啥——顶级扫描仪冷光源零损伤翻拍分辨率高到能看到纸张纤维。技术路线早期走的是与谷歌合作后来转向自建平台目前已将大量善本、方志、家谱开放给全球读者。听上去很美对吧可大胖老师抛出一个问题“你搜过他们的OCR文本吗试试看。”小菜打开哈佛燕京的线上阅览页面选了一部清刻《论语》扫描本上面虽然有文字层但一复制粘贴满屏的错乱。比如“子路問政”成了“子路問政”“政”字有时还变成“攻”。原来他们早期的OCR引擎是英文系统对中文竖排支持有限大部分文本是靠人工录入或外包校对成本高到离谱。小菜啧啧“这是把奔驰发动机装在了牛车上——马力大但方向偏了。”更扎心的是版权问题。哈佛燕京很多数据虽然开放但使用协议严格商业二次开发基本没戏。而且他们专注的是馆藏精品对中国大陆海量的县级方志、契约文书等乡土文献覆盖不到。大胖老师总结“美国模式像请米其林大厨做佛跳墙精细是精细可一天也就供几桌没法解决大众需求。”三、欧洲流派跨语种联盟标准化先行但中文靠边代表欧洲数字图书馆Europeana与“时间机器”项目Europeana聚集了欧洲上千家机构的数字化资源文本、图片、音视频都有。他们的强项是建立了严格的元数据标准什么Dublin Core、METS、ALTO一听就让人头大但保证了跨馆检索的互通性。不过这里面中文古籍占比极小OCR引擎主要以拉丁字母为主对汉字只能用通用的老模型准确率惨不忍睹。还有个雄心勃勃的“欧洲时间机器”Time Machine项目试图用AI重建欧洲城市历史。大胖老师摇摇头“人家忙着复原古罗马街道咱们还在纠结竖排怎么识别根本不在一个赛道。但他们的标准化思路值得学我们将来导出数据也得遵从业界规范不然信息就成孤岛了。”四、东亚近邻日本很精细韩国爱整合各有绝活日本国立国会图书馆与“古文OCR”日本在古籍数字化上做得相当细腻。比如国立国会图书馆的“NDL OCR”专门针对日本古典籍和近代文献。它们训练了专门的手写体、变体假名模型甚至能处理江户时代的草书。技术上采用深度学习针对竖排、行草有专门优化。但大胖老师指出这套系统主要针对日文汉字和假名对于中文繁体、异体字特别是俗字和避讳字处理能力一般。而且他们走的是国家牵头、统一平台的路子我们国家体量更大各省馆藏离散无法照搬。韩国韩国古典翻译院与“Hantopia”韩国将大量汉文古籍韩国的古代文献多用汉字书写数字化建立了“韩国古典综合DB”。他们用的是定制OCR引擎加上大量人工校正准确率高。但缺点是封闭系统不对外我们只能望着流口水。大胖老师调侃“人家是把自己的东西护得严严实实我们是恨不得全公开。文化自信的姿势不一样啊。”五、台北故宫与台湾“国图”精品化但门槛高台北故宫博物院对书画、文献的数字化堪称艺术品级别。他们多用高精度扫描搭配人工著录。后来也尝试引入OCR但多是针对印制文本。2018年曾与台湾“中研院”合作开发古代文书识别系统主要用于清代奏折效果不错但局限在特定类型而且系统未完整开源。小菜感叹“技术是好可我们连访问都经常被墙学术交流都靠翻墙更别说拿来用了。”大胖老师敲他脑袋“别扯远重点是人家走的是精品路线一件一件雕琢没法批处理县级的四万页契约。”六、大陆现状国家队与民间力量星星之火正在燎原讲完海外大胖老师把投影切回国内光点密集起来。“咱们自己其实也没闲着。”国家队代表国家图书馆中国国家数字图书馆国图从2012年起就大规模扫描古籍到2023年已发布超过10万部数字善本但多数只提供图像有完整文字识别的比例不高。他们内部用过商业OCR引擎也尝试过与科技公司合作定制但因为古籍的复杂性一直没能推出通用方案。2021年国图牵头启动“中华古籍资源库”升级开始引入AI识别试点。大胖老师说“国家队是风向标他们一动下面的省市就跟。但国家队太大项目论证都得两年我们等不及。”高校与科研机构北大、浙大、哈工大等北京大学数字人文中心长期研究古籍结构化开发了“吾与点”古籍标注平台侧重众包校对。浙江大学团队用深度学习做过墓志铭识别哈尔滨工业大学做手写满文识别各有专攻。但问题是这些大多是实验室产品没工程化成一套简单易用的系统离开校园就水土不服。小菜笑道“这就像每个食堂都有拿手菜但没有一家能开连锁店。”民间力量与开源社区2020年之后很多民间爱好者利用PaddleOCR等开源工具自搭古籍识别系统发在B站、GitHub上。比如有人搞了个“古诗文OCR”专门识别《唐诗三百首》效果惊艳但换成本地方志就歇菜。还有不少数据标注众包项目比如“古籍在线校对”小程序聚集了数千志愿者帮忙校对OCR结果。大胖老师点赞“民间的活力很足缺的就是一个稳定、全面、开源的平台来整合这些能量。”七、我们的底气和差距一场“非对称作战”的战术选择小菜听完一圈既兴奋又焦虑“大胖老师别人要么有钱要么有积累咱们就俩穷教授加几个学生拿什么拼”大胖老师一乐“别自己吓自己。首先差距要承认我们没有哈佛的钱没有国图的资源没有台北故宫的设备。但我们的优势恰恰在于——无包袱能快速试错而且站在了AI开源爆发的风口上。你想想2016年之前深度学习OCR还不成熟2019年PaddleOCR才刚出来2021年PPStructure版式分析才完善到了2023年这些组件已经强到可以对付古籍了。我们只是把最好的轮子找出来为中国的烂路做一套避震系统这事不需要造火箭的团队。”他掰着手指列出三条底气技术民主化红利PaddleOCR的繁体竖排模型在2022年已经相当能打我们不用从零训练只需调参和补充数据成本骤降。场景聚焦我们不贪大求全只专注“中文古籍图像类PDF”这一细分深度优化。别人一个引擎打天下我们是专精一种兵器砍柴就比瑞士军刀快。开源本地化所有数据不出馆打消了图书馆最大的安全顾虑代码全开源馆员自己就能维护不会被厂商锁定。这种模式恰是国外大厂和国内商业公司都给不了的。“这就叫‘你打你的我打我的’。他们在城里开4S店我们在乡镇修便民服务站服务对象不同但价值一点不小。”大胖老师合上电脑仿佛已经看到“文渊慧典”在某个县图书馆悄悄亮起绿灯。八、本章结语我们不是一个人在战斗其实从2016年“互联网中华文明”行动计划启动到2022年《关于推进新时代古籍工作的意见》出台政策东风一阵紧似一阵。全国古籍普查平台已经积累了数百万条书目数据各地图书馆的扫描仪也嗡嗡转了多年唯独缺最后一步——把图像变成可检索的知识。我们的“文渊慧典”就是要补上这临门一脚。不是从零发明而是把散落在实验室、开源社区、民间爱好者手里的珍珠串起来做成一条普通人戴得起的项链。大胖老师最后说了一段话后来被写进项目说明书扉页“我们在干的事跟1960年代美国把阿波罗送上月球不一样那时候要举国之力。我们要做的是把‘阿波罗’的技术拆成自行车配件让每个村庄都能自己造一辆骑向知识的银河。”小菜偷偷在笔记本上画了一辆带火箭筒的自行车下面歪歪扭扭写着“文渊慧典号向着竖排繁体出发”本文为注水技术版您看看即可不必当真写此文字就是图一乐-