尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

LLM-Cave: A benchmark and light environment for large language models reasoning and decision-maki...

LLM-Cave: A benchmark and light environment for large language models reasoning and decision-maki... 文章总结与翻译一、主要内容本文针对现有大语言模型(LLMs)评估基准局限于单步交互、现有序列决策环境复杂且计算成本高的问题,提出了轻量级基准框架与环境LLM-Cave。该环境基于经典的Wumpus World问题,通过文本交互形式,要求模型控制智能体在洞穴网格中,依据 breeze(微风)、stench(恶臭)等间接感官信号推理陷阱和怪兽的位置,最终安全找到黄金,以此评估模型的多步推理与决策能力。研究中还设计了两种核心增强机制:一是推测链(Chain of Speculation),让模型明确生成并迭代更新对环境危险位置的假设,形成结构化推理记忆;二是规划-批评家(Planner-Critic)双角色反馈框架,规划器生成决策,批评家评估决策安全性并提出优化建议。实验对GPT-4o-mini、o1-mini、Claude 3.5、Gemini 2.5 Flash、DeepSeek-R1等主流模型进行了测试,结果显示:DeepSeek-R1在复杂推理任务中成功率最高;较弱模型(如4o-mini)通过上述两种机制显著缩小了性能差距(4o-mini成功率从44%提升至50.67%),但需以增加计算开销为代价;LLM-Cave能有效区分不同模型的推理能力,为LLM评估提供了新的推理导向基准。二、创新点提出轻量级文本交互环境LLM-Cave,专门用于评估LLM的多步推理与决策能力,兼顾部署便捷性与结果可解释性,弥补了现有基准与实际多步决策场景的差距。设计推测链(Chain of Speculation)推理策略,让模型明确生成对危险位置的
返回列表