
文章主要内容和创新点总结一、主要内容本文聚焦于利用大型语言模型(LLMs)进行文本表示的优化问题。由于多数LLMs本质上是因果模型,优化目标为下一个token预测,难以生成整体连贯的序列级表示,现有方法多依赖token级 pretext 任务(如LLM2Vec的MNTP、Llama2Vec的EBAE/EBAR),但这类方法难以完整保留序列语义完整性。为此,本文提出以上下文压缩作为无监督适配LLMs的pretext任务,让模型学习生成紧凑的“记忆token”替代原始上下文用于下游序列预测,并设计了三种压缩目标:重构任务(重建原始句子)、续篇任务(生成后续token,CT-NLL)、知识蒸馏续篇任务(CTKD,结合续篇目标与知识蒸馏,对齐压缩上下文与原始上下文的下一个token预测分布)。实验发现CTKD是最优目标,能缓解维度坍缩问题;进一步通过无监督对比学习(UCL)和有监督对比学习(SCL)后处理,提出模型LLM2Comp。在MTEB基准的14个任务(含聚类、检索、语义相似度等)中,LLM2Comp不仅性能优于LLM2Vec、Llama2Vec等现有模型,且样本效率更高,所需训练数据显著更少。二、创新点探索了上下文压缩作为LLMs文本表示适配的pretext任务潜力,系统分析了压缩目标(重构、CT-NLL、CTKD)和记忆token数量对性能的影响,确定CTKD为最优目标。揭示CTKD相比其他压缩目标的优势源于其能更好地缓解维度坍缩问题,通过保留低频token信息提升表示质量。