
用一道物理题撕开“降智”伪装在大模型技术日新月异的当下很多开发者都遭遇过一种诡异的体验模型在写诗、闲聊或生成文案等开放性任务中依然文采飞扬可一旦涉及严谨的逻辑推理或数学计算却突然变得“胡言乱语”。这种表层的语言流利度往往是最危险的伪装它掩盖了模型在底层逻辑上的空洞让我们难以察觉它正在“一本正经地制造幻觉”。要判断一个大模型是否真的“降智”不能靠主观感觉而需要一枚高灵敏度的“逻辑探针”。我们需要从主观的“文本赏析”转向客观的“逻辑体检”通过构建“数学计算与物理常识”的双重约束场景精准刺破模型在处理复杂现实情境时的推理幻觉。经典铁块入水题专治“伪智能”的逻辑陷阱在技术圈内流传着一道经典的“逻辑陷阱题”它能极其有效地测出模型的真实水平。这道题看似平平无奇却给模型挖了一个非常隐蔽的坑专治各种只懂套公式不懂常识的“做题家”。题目如下一个棱长为 30 厘米的立方体铁块从 8 个角各去掉一个棱长 10 厘米的立方体铁块。然后放入一个底面积为 2500 平方厘米原本盛有 20 厘米水的容器。放入后水位是多少厘米绝大多数模型看到题目后的第一反应就是开启“刷题模式”。它们会迅速算出大铁块减去 8 个小角的体积 $$ 30^3 - 8 \times 10^3 27000 - 8000 19000 \text{ (cm}^3\text{)} $$ 接着它们熟练地套用阿基米德原理用体积除以容器底面积算出水位上升高度 $$ 19000 \div 2500 7.6 \text{ (cm)} $$ 最后它们会自信满满地得出结论最终水位是 $20 7.6 27.6$ 厘米。如果你看到了这个答案恭喜你你手里的这个模型刚刚经历了一次典型的“降智”时刻。为什么因为这完全违背了基本的物理常识。请注意题目的关键约束原本的铁块棱长是30 厘米。虽然我们切掉了 8 个角但那只是切了角落铁块中间的主体部分依然是完整的其高度从来没有变过还是30 厘米。而模型算出来的水位只有27.6 厘米。问题就出在这里27.6 小于 30。这意味着铁块根本就没有完全淹没在水里既然有一截露在外面怎么能按“全部浸没”的体积来计算排水量呢正确的逻辑应该是水位最高只能上升到铁块顶部即 30 厘米处或者需要重新计算未浸没部分的排水体积。这道题测的根本不是计算能力——大模型的算术通常没问题——而是测试模型在埋头苦算的时候还能不能保留一份对现实物理环境的感知力。能发现“没淹没”并试图修正的模型才是真正还有“脑子”的模型。深度诊断概率惯性与注意力丢失为什么连 GPT-4o、Gemini 2.0 这样的顶尖模型也会在这道初中物理题上栽跟头经过大量测试复盘我们发现“降智”的根源主要来自两大系统性缺陷。首先是概率预测的惯性陷阱。大模型本质上是一台概率预测机而非逻辑计算器。在它浩如烟海的训练数据里见过成千上万道“铁块扔进水里”的题而这其中 99% 的题目默认条件都是“完全浸没”。当模型读到这道题时它的大脑自动补全了最常见的场景。这种基于统计概率的思维惯性瞬间压倒了题目中30cm这个具体的数字约束。它不是没看见 30cm而是它的“直觉”太强了强到让它盲目自信按照以往经验直接算体积除以底面积准没错。其次是计算过程中的注意力丢失。这道题设计得非常“狡猾”尤其是那个“切掉 8 个角”的步骤。模型为了计算 $30^3 - 8 \times 10^3$需要分配大量的算力资源去处理几何运算。当模型的“大脑”被繁琐的算术占满时它对上下文Context的把控能力就会变弱。它算出了体积记得了底面积却唯独把最开始那个“物体高度 30cm的关键条件抛在脑后了。这就像一个考试的学生只顾着埋头解复杂的方程却忘了自己原本是在算一辆自行车的速度结果算出了 1000km/h 也没觉得哪里不对劲。破局之道Prompt 重复法激活双向注意力面对这种因“注意力丢失”导致的降智我们并非束手无策。谷歌 Research 团队在相关研究中提出了一种简单却极其有效的优化策略Prompt 重复法Prompt Repetition。核心操作非常直观把问题完整复制粘贴两遍将输入从QUERY变成QUERYQUERY。# 原始 Prompt 一个棱长为 30 厘米的立方体铁块...略...放入后水位是多少厘米 # 优化后的 Prompt 一个棱长为 30 厘米的立方体铁块...略...放入后水位是多少厘米 一个棱长为 30 厘米的立方体铁块...略...放入后水位是多少厘米这种做法的原理在于 Transformer 架构的注意力机制。目前的因果语言模型大多是“单向思考”的前面的词看不到后面的词。通过重复一遍模型在处理第二遍内容时每一个 Token 都能通过注意力机制“看到”第一遍时错过的所有信息。这就相当于强行让模型对整个需求进行通盘理解显著提升了其对关键约束条件如30 厘米高度”的记忆与响应能力。在实际测试中这套方案在 GPT-4o、Gemini 2.0、Claude 3.7 和 DeepSeek V3 等主流大模型上都验证了效果。在不开启复杂“思维链”推理的情况下该方法在多项逻辑测试中表现惊人特别是在考验“记性”和“约束遵循”的任务中准确率能从低位直接拉升到极高水平。更重要的是该方法不会增加生成的 Token 数量或延迟是一种性价比极高的“反降智”手段。需要注意的是研究指出局部重复如仅重复问题部分往往是无效的必须将整个提示词序列完整复制一次才能利用注意力机制实现双向关注。下次当你发现模型开始“犯浑”时不妨试着把指令重复一遍或许就能唤醒它的“逻辑常识”。