尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

Uncertainty Quantification for Large Language Model Reward Learning under Heterogeneous Human Fee...

Uncertainty Quantification for Large Language Model Reward Learning under Heterogeneous Human Fee... 文章核心总结与翻译一、主要内容本文聚焦大语言模型(LLM)对齐中基于人类反馈的强化学习(RLHF),针对人类反馈异质性和奖励模型不确定性两大核心问题展开研究。提出异质偏好框架,联合建模答案的潜在奖励与人类理性,通过交替梯度下降算法求解双凸优化问题;建立估计量的收敛性和渐近分布等理论保证,构建奖励估计的置信区间;将不确定性量化结果应用于奖励的统计比较和最优N选1(BoN)策略优化,提出悲观BoN(pBoN)策略;通过大量模拟实验和真实LLM数据验证方法的有效性。二、创新点方法创新:设计异质理性模型捕捉人类专业水平差异,提出交替梯度下降算法,实现奖励模型与人类理性模型的联合学习。理论创新:证明算法的收敛性,推导估计量的渐近分布,为奖励模型提供严格的不确定性量化,建立悲观BoN策略的次优性边界。应用创新:将不确定性量化融入奖励差异的假设检验,实现LLM输出的统计严谨比较;优化BoN策略,通过奖励下界提升决策鲁棒性。三、关键部分翻译(Markdown格式)Abstract我们研究用于大语言模型(LLM)对齐的奖励模型的估计与统计推断问题。LLM对齐的核心技术是基于人类反馈的强化学习(RLHF)——人类对模型生成的答案对进行比较,其偏好被用于训练奖励模型。然而,人类反馈
返回列表