尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

On the Limits of Innate Planning in Large Language Models

On the Limits of Innate Planning in Large Language Models 文章主要内容总结该研究以8拼图任务为测试载体,在不依赖代码执行等外部工具的情况下,探究了4个大语言模型(GPT-5-Thinking、Gemini-2.5-Pro、GPT-5-mini、Llama 3.1 8B-Instruct)的内在规划能力和状态跟踪能力。研究采用零样本(Zero-Shot)、思维链(CoT)、思维算法(AoT)三种提示策略,结合重复、特定、提示性三级反馈机制,还引入外部移动验证器辅助模型筛选有效移动。结果显示,所有模型表现均存在显著缺陷:无外部工具时仅GPT-5-Thinking在AoT提示+提示性反馈下达到68%的成功率,且需消耗大量计算资源;即使有外部移动验证器辅助,所有模型仍无法完成任何拼图。核心问题集中在两点:一是内部状态表示脆弱导致频繁无效移动,二是启发式规划能力薄弱引发循环或无进展动作。创新点总结设计了无工具依赖的8拼图评估方案,通过统一协议隔离提示策略与反馈的独立影响,精准聚焦模型内在能力。开展细粒度失败模式分析,不仅统计成功率,还拆解模型终止任务的具体原因(如无效移动、循环、提前停止等)。引入外部移动验证器条件,剥离状态跟踪负担,单独评估模型的纯规划能力,量化了无状态跟踪瓶颈时的目标导向能力缺陷。构建三级反馈机制与三种提示策略的组合实验,系统探究了不同干预手段对模型规划性能的调制效果。Abstract 翻译大型语言模型(LLMs)在众多基准测试中取得了令人瞩目的成果,但其规划能力和状态推理能力仍不明确。我们直接研究这些
返回列表