
文章核心总结与翻译一、主要内容本文针对大型语言模型(LLMs)在汉语第二语言习得(SLA)中的分阶段建模与写作评估需求,提出首个基准测试套件HSKBenchmark。该套件涵盖HSK3-6级的676万词级教材数据、1.6万条合成指令数据及30个真实HSK写作测试话题,通过课程调优框架模拟人类从初级到高级的习得轨迹,并构建包含语法点覆盖、写作错误、词汇复杂度等五个维度的语言评估体系,配套开发HSKAgent实现自动化评估。实验验证显示,经调优的LLMs写作表现比肩高级汉语学习者,且呈现类人习得特征,为语言习得建模与LLMs可解释性研究提供基础工具。二、创新点首次构建汉语第二语言习得的分阶段基准测试套件,填补现有评估缺乏层级化数据与动态评估能力的空白。提出课程调优框架,按HSK等级循序渐进开展预训练与指令微调,精准模拟人类第二语言习得轨迹。设计多维度语言评估体系,结合HSKAgent实现语法检测、错误识别、分数预测等自动化评估,达成与人类评分员的高一致性。验证了LLMs在汉语(孤立语)习得中的类人特征,为跨语言类型的习得建模提供新视角。三、核心部分翻译(Markdown格式)Abstract语言习得对于揭示人类语言智能的本质至关重要,近年来已成为提升大型语言模型(LLMs)可解释性的重要视角。然而,开展需要控制人类学习者语言输入的实验在伦理和