
文章主要内容与创新点总结一、主要内容本文针对现有大型语言模型(LLM)基准测试存在的静态化、易受数据污染、未考虑资源约束与对抗场景等问题,提出了名为SQUID GAME的动态对抗性评估框架。该框架灵感源自同名电视剧,通过六个淘汰赛制关卡,在资源受限、信息不对称的环境中,对52个LLM(28个专有模型、24个开源模型)的多维度能力进行评估。核心评估原则淘汰制而非计分制:采用“大逃杀”式相对排名,每轮淘汰一定比例模型,后续关卡难度随幸存者能力动态提升,聚焦“相对优势”而非“绝对知识量”。资源约束:设置令牌或API调用配额限制,评估模型的令牌利用率与推理效率,模拟真实场景中的资源压力。信息不对称:打破传统测试的“完全信息假设”,通过动态未知场景(如玻璃桥)迫使模型在不确定性下决策,侧重“实际能力”而非“已知知识”。动态对抗评估:构建交互式、攻防兼备的场景(如辩论、安全越狱测试),形成自进化的评估环境,难度随对手智能自动调整。六个评估关卡及核心目标关卡核心评估能力具体任务描述红