尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

Evaluating Multimodal Large Language Models on Vertically Written Japanese Text

Evaluating Multimodal Large Language Models on Vertically Written Japanese Text 文章主要内容与创新点总结一、主要内容研究背景:多模态大语言模型(MLLMs)在视觉文档理解任务中应用广泛,但针对日语竖排文本的处理能力研究较为匮乏。日语文档常包含竖排形式,其阅读顺序(自上而下、从右至左)与横排文本(自左至右、自上而下)存在显著差异,现有OCR基准测试多侧重横排文本,忽视了竖排文本的评估需求。数据集构建:合成数据集JSSODa:通过LLM生成日语文本,渲染为包含1-4列布局的横排/竖排图像,共22,493张,按8:1:1划分为训练集、验证集和测试集,用于模型微调与评估。真实场景数据集VJRODa:从日本真实PDF文档中提取含竖排文本的页面,经筛选、转录和人工校正得到100张图像,用于模拟真实场景下的模型评估。实验设计:选取Qwen2.5-VL、InternVL3、Gemma 3等开源模型及GPT-4.1、GPT-5等闭源模型,通过字符错误率(CER)和BLEU值评估其横排/竖排日语文本识别能力,并验证JSSODa数据集的微调效果。核心发现:现有MLLMs处理竖排日语文本的准确率显著低于横排文本,部分模型存在阅读顺序混淆问题。基于JSSODa的微调能大幅提升原本不擅长竖排文本处理的模型性能(如Qwen2.5-VL-7B),但对已初步掌握竖排阅读规则的模型提升有限。真实场景数
返回列表