Control Barrier Function for Aligning Large Language Models
文章总结与翻译一、主要内容本文提出一种基于控制理论的大型语言模型(LLM)对齐框架CBF-LLM,核心是引入控制障碍函数(CBF)构建安全过滤器,确保模型生成符合用户期望(如积极正向)的文本。核心背景与类比LLM虽具备强大的语言理解、推理和写作能力,但可能生成有害、有偏见或不道德的内容,对齐技术旨在解决这一问题。文章将LLM对齐与控制系统中的避撞问题类比:把LLM比作车辆,生成的文本序列比作车辆轨迹,两者均需通过合理控制策略避免进入非期望状态(车辆避撞、LLM避免生成有害内容)。框架设计核心组件:由基线LLM(如Llama 3)、语言约束函数(L-CF)和CBF过滤器构成。L-CF用于区分文本是否符合期望(如基于RoBERTa情感分析模型构建,输出正值表示积极文本);CBF过滤器通过离散时间CBF不等式约束,筛选出满足对齐目标的令牌分布,仅允许使文本保持或提升期望程度的令牌通过。关键特性:CBF过滤器采用附加式设计,无需微调基线LLM的参数,可灵活适配不同对齐目标和各类LLM;支持单步和多步预测两种模式,多步模式可避免单步模式过于保守的问题(如过滤掉“先负后正”的合理文本)。实验验证以生成积极文本为对齐目标,基于Llama 3和RoBERTa模型实现CBF-LLM,通过Reddit数据集进行实验。结果表明:CBF-LLM能有效避免生成非积极内