《大话文渊慧典》:外三篇-日本人认草书,韩国人封数据,美国人狂砸钱:古籍OCR的世界地图
——大胖老师“二黑你跑过那么多地方用一句话概括各国古籍OCR的特点怎么说”——二黑不假思索“日本人能把草书认成印刷体韩国人把数据锁得比军火库还严美国人呢钱多得能砸死问题但问题太皮实砸不死。”——小菜“那咱们中国呢”——二黑推了推眼镜“咱们是满汉全席的食材大排档的厨房米其林的野心但目前还在煮方便面。”——大胖老师一口枸杞茶差点喷出来“二黑你今天怎么回事比喻密集得跟机关枪似的。”一、二黑的世界地图二黑从美国回来后大胖老师交给他一个任务把全球古籍OCR的技术格局梳理清楚给实验室做一个内部报告。二黑熬了两个通宵拿出一份被他称为《古籍OCR全球态势感知》的PPT。这份PPT后来在圈内小火了一把被好几个高校的图书馆请去分享。它的精髓是一张手绘风格的世界地图上面标注了几个主要“玩家”的绝活和槽点。二黑把地图投在屏幕上小菜凑过去看只见上面画得花花绿绿日本区域画了一幅草书旁边标注“假名都能认汉字差点意思。”韩国区域画了一道大铁门门上挂了三把锁标注“数据是国宝可惜不出门。”美国区域画了一台印钞机正哗哗地往一个叫“古籍数字化”的坑里撒钱标注“钱能解决的问题都不是问题问题是古籍OCR不是光靠钱就能解决的。”欧洲区域画了一座精雕细琢的钟楼标注“标准化做到极致但中文古籍还在排队等叫号。”台湾地区画了一个精美的展示柜标注“精品中的精品但产量低得像手工作坊。”中国大陆区域画了一锅沸腾的火锅标注“什么食材都有火也旺但缺一个好锅底。”大胖老师看完哈哈大笑“二黑你这地图拿到学术会议上发表估计能拿个最佳可视化奖。不过玩笑归玩笑里面的门道你得讲清楚。今天咱就按你这张地图一个国家一个国家地扒。”二、日本草书都能认但遇到中文异体字就变成了“大预言家”二黑在日本待过两个月专程去国立国会图书馆考察过NDL OCR。他讲起日本的古籍OCR表情既钦佩又带点微妙的揶揄。“日本的古籍数字化起步比我们早至少领先十年。他们最大的成就是什么手写体识别做到了极致。特别是变体假名——一种日本特有的草书字符写法变化多端人眼看都费劲NDL OCR能认到90%以上。还有江户时代的候文一种书信文体连笔潦草得跟心电图似的他们的模型也能输出通顺的文本。这背后是十几年的积累模型是一点一点用大量标注数据喂出来的。”小菜啧啧称奇“那中文古籍不也一样吗汉字也是他们的文字啊。”二黑摇头“你犯了一个经典的误解。日本古籍里的汉字和中文古籍里的汉字重合度虽然高但使用习惯和字形分布差别巨大。我举个例子——‘国’字。日本现代用‘国’古籍里偶尔用‘國’。但中文古籍里‘國’字有几十种写法囯、囻、囶、国、䆐……有些是俗字有些是避讳字有些是刻工随手省了几笔。日本模型只见过标准的‘国’和‘國’碰上‘囻’它直接蒙了——最常见的情况是输出一个假名或者干脆跳过假装那个字不存在。更别说中文古籍里的避讳缺笔字了。康熙缺‘玄’乾隆缺‘弘’这些政治正确导致的字形变异日本古籍里几乎没有模型自然没学过。”“所以”大胖老师总结“日本是‘认自己的字让别人乱码去吧’。他们的优化方向是日语中心中文是附带品。能用但别指望精准。”三、韩国数据锁得比核密码还严技术再好也不给你看韩国的情况二黑是通过文献和几次国际会议的侧面了解拼凑出来的。不是因为他不努力而是韩国在这方面的封闭程度堪称全球之最。“韩国古典翻译院有一个很厉害的系统叫Hantopia专门用于处理韩国汉文古籍——韩国古代文献大量使用汉字书写包括《朝鲜王朝实录》《日省录》这些国宝级的文献。他们从上世纪九十年代就开始搞数字化投入巨大据说OCR准确率极高还能自动标注人名、地名、官名甚至做了初步的句读。但问题是——”二黑竖起两根手指“第一不公开。第二不开源。第三不提供API。第四连学术交流都只给看演示视频。”小菜不解“为什么呀技术分享不是好事吗”二黑推了推眼镜“我分析有几个原因。一是数据主权意识极强他们觉得古代文献是民族记忆不能假手于人。二是担心版权和滥用怕自己辛苦数字化好的文本被别人爬走。三是——我不负责地猜测——可能也有点‘不愿为人做嫁衣’的心态。毕竟汉文古籍也是东亚共同的文化遗产韩国花了大力气整理好免费开放给中国学者用他们估计不乐意。结果就是全世界都知道韩国做得好但没有人知道他们到底怎么做的。他们的古籍OCR就像38线北边的山——你知道那儿有东西但你看不见。”大胖老师感叹“这不叫技术壁垒这叫技术碉堡。把自己保护得好好的但也把自己锁得死死的。我们虽然做得晚但从一开始就定了开源开放的基调。开放不一定能赢但封闭迟早会输。因为数据可以锁但算法是锁不住的。全世界都在进步你关起门来称王早晚被人从外面敲开。”四、美国钱不是问题问题是花钱的方向不太对讲美国之前二黑先放了一张图片哈佛燕京图书馆的数字化工作室一排高端扫描仪冷光源自动翻页装置看起来像科幻电影里的实验室。“美国佬是真有钱。”二黑感叹“光哈佛燕京一个馆每年古籍数字化的预算就有200多万美元。扫描仪是定制的几十万一台一买就是好几台。他们还有专门的数字保存部门负责数据备份、格式迁移、长期可读性保障。流程之规范标准之严格让你肃然起敬。但他们的钱七成以上花在了硬件、扫描外包、元数据著录这些外围环节上真正投给OCR核心技术研发的比例不到10%。甚至不到5%。”小菜问“为什么他们不是有最牛的AI吗”二黑说“问题就出在这个‘最牛的AI’上。美国最顶尖的AI人才都被谷歌、微软、OpenAI用年薪百万美金挖走了谁愿意跑到图书馆搞古籍所以哈佛只能买谷歌N年前开发的通用OCR。钱砸进去解决的是扫描和元数据问题核心的识别质量一直是个短板。”二黑接着讲了另一个例子美国国会图书馆的“美国记忆”项目数字化了几百万件历史文献包括大量19世纪的中文移民档案和华侨报纸。但他们的OCR引擎对中文完全是外行移民档案里的手写汉字几乎全军覆没报纸的竖排也乱成一团。后来他们自己想了个办法——众包。把识别不了的文字图片发到网上让志愿者来辨认和录入。效果倒是有一点但速度极慢一个汉字可能要等好几天才有人认出来。大胖老师点评“美国人解决问题的思路一向是‘用钱砸’。但古籍OCR不是砸钱就能砸出来的它需要的是领域知识的长期积累、大量高质量标注数据的沉淀、还有一群愿意坐冷板凳慢慢调参的工程师。这些光靠钱买不来。而且美国在中文古籍OCR上的投入意愿明显不足——毕竟不是自家的核心文化再重视也隔了一层。”五、欧洲标准制定了一箩筐中文古籍还在排队欧洲的情况大胖老师亲自补了一段。他在2019年去欧洲参加过一次数字人文会议印象极深。“欧洲的数字图书馆——像Europeana——强在哪标准。Dublin Core、METS、ALTO、TEI他们制定了一整套数字化元数据标准精细到你一本书的每一页、每一行、每一个字的坐标都能结构化存储。全欧洲几千家图书馆和文化机构用同一套标准描述数字资源跨库检索丝般顺滑。这是他们最厉害的地方必须服气。”“但弱在哪弱在他们的标准体系里中文古籍是个边缘体。Europeana收录的中文文献数量加起来可能还不如我们一个省馆。原因很简单欧洲的主流文字是拉丁字母他们的整个数字化技术栈——从扫描参数到OCR引擎到元数据规范——都是围绕拉丁字母设计的。中文那是遥远的东方异类。所以欧洲的数字人文圈子虽然牛但中文古籍对他们来说始终是‘别人家的事’。不是不友好是顾不上。”大胖老师比喻道“欧洲就像一座精装修的宫殿里面家具摆放得整整齐齐标注得明明白白。但宫殿里留给中文古籍的房间小得像个杂物间。”六、中国台湾省精雕细琢的“手工作坊”台北故宫和台湾“中研院”的古籍数字化二黑在之前的分析中已经提过。这次他用了“手工作坊”这个比喻。“他们做的不是大规模工业化生产是量身定制的高级定制。一年就做几百件每件都精雕细琢超高像素扫描、多光谱成像、专业级OCR、人工逐字校对、印章识别、笔迹分析……做出来的确实是艺术品。清代奏折的馆阁体识别准确率据说达到95%以上。但问题是这套工艺没法推广。成本太高系统封闭只服务自己的精品馆藏。对于大陆面临的几千万册古籍的规模化数字化需求这套模式没有参考价值。他们是劳斯莱斯定制工厂我们需要的是五菱宏光生产线——皮实、能装、哪都能修。”七、中国满汉全席的食材需要一个好厨师终于轮到讲中国。二黑在地图中央画了一个巨大的圈。“我们的优势是什么第一体量。几千万册古籍全世界最大的中文文献存量和增量数据源天然是我们的。第二技术储备。PaddleOCR的开源社区已经把中文OCR的基础模型做到了世界领先水平我们的‘文渊慧典’正在这个基础上做古籍领域的深度适配。第三需求端的觉醒。从国图到县馆从学者到民间爱好者古籍数字化的需求正在以前所未有的速度释放。这是食材、火候、市场什么都有了。”“我们的劣势呢”小菜追问。二黑伸出三根手指“第一积累不够。人家干了二十年我们大规模起步不到十年。第二协作不够。北大一套浙大一套国图一套…………——各家都有独门绝技但各做各的不成合力。第三落地不够。很多技术还停留在实验室和论文里没有变成王大姐能用的工具。”大胖老师接过话语气变得严肃“所以‘文渊慧典’不仅是一个工具更是一个信号——我们开始把技术送下基层送到每一个需要它的地方。不需要百万预算不需要博士团队一台电脑一个软件就能开始干。只有到了那一天这张世界地图上中国的标记才能真正亮起来。”八、尾声下一张世界地图什么样报告结尾二黑把当前的世界地图定格然后翻到下一页PPT。上面是一张全新的地图许多标记都换了位置。他说“这是我个人预测的未来五年格局。日本会更精细化但中文瓶颈仍然无解韩国可能会选择性开放部分成果但整体方向还是保守美国的资金和技术会进一步集中在AI大模型上古籍OCR会被大模型覆盖一部分但准确性和专业性仍有短板欧洲对不起中文古籍可能还是排不上号我国台湾省会继续保持精品路线。而中国——”他把中国的标记从一个沸腾的火锅改成了一个信号塔。信号塔四周无数个小点正在亮起。“中国可能会走出一条完全不同的路不是砸钱不是封闭不是手工作坊而是用开源协作的方式把全国甚至全球的开发者、馆员、学者都动员起来用最低的成本覆盖最广的领域把古籍OCR做成数字世界的基础设施。这是我们唯一能走通的路也是最符合中国国情、最有可能后来居上的路。”小菜看着那张全新的地图忽然觉得自己正在做的事情比想象中更大。大胖老师端起保温杯对二黑说“你这个地图以后每更新一次我请你喝一次茶。”二黑面无表情“老师您那个枸杞茶我真的喝够了。”大胖老师“那请你喝咖啡。”二黑“美式不加糖。”小菜“我也要。”窗外夜已经深了。实验室的灯还亮着三颗脑袋凑在一张世界地图前讨论着下一站该往哪个坐标投下代码的种子。本文为注水技术版您看看即可不必当真写此文字就是图一乐-