
LLaSO相关总结与翻译一、文章主要内容LLaSO是一个为大规模语音语言模型(LSLMs)研究打造的全开放端到端框架,旨在解决LSLM领域架构碎片化、透明度缺失、可复现性差等问题。核心资源构成LLaSO-Align:含1200万条语音-文本对齐语料,源于对话语音、朗读叙事、有声书籍、带口音语音等多种来源,通过18种手动设计的指令模板,将自动语音识别(ASR)重构为指令遵循对齐任务,为语音与文本语义空间对齐奠定基础。LLaSO-Instruct:含1350万条多任务指令微调数据,覆盖语言、语义、副语言3大类20项任务,支持文本指令+音频输入、音频指令+文本输入、纯音频(指令与输入均为音频)3种模态配置,同时兼顾开放式和封闭式任务,补充了副语言任务(如说话人特征识别、声学线索分析)在现有资源中的不足。LLaSO-Eval:含15044条分层抽样的评估基准,涵盖上述3大类20项任务,支持3种模态配置评估,采用WER、CER、PER、Accuracy、MAE、GPT-4o评分、弃权率7类指标,可全面测试模型在已知和未知任务、不同模态下的泛化能力。LLaSO-Base:基于LLaVA架构适配语音领域的38亿参数参考模型,仅使用LLaSO-Align和LLaSO-Instruct训练,在LLaSO-Eval上归一化得分0.72,超过同类模型(最佳为0.65),为领域提供了可复现的强基准。