LTD-Bench 文章总结与翻译一、主要内容现有LLM评估的痛点:当前大语言模型(LLMs)评估依赖抽象数值指标,无法直观反映模型的空间推理能力,导致报告性能与实际应用(如机器人、自动驾驶、设计工具等需物理世界理解的场景)存在脱节,且未系统评估语言与空间概念的双向映射能力。LTD-Bench 核心设计:提出一种新型评估基准,通过让模型生成可视化输出(点矩阵或可执行绘图代码),将抽象评估转化为直观视觉结果。包含两大互补任务:生成任务(空间想象力):将文本描述转化为视觉表征;识别任务(空间感知力):解读视觉模式并转化为语言。任务分为三个难度等级(简单、普通、困难),共183个数据样本,覆盖从基础字符到复杂现实物体的空间推理场景。实验结果:对DeepSeek-R1、GPT-4o、Llama3.3等先进模型的评估显示:现有LLM空间推理能力普遍薄弱,仅Deepseek-r1平均准确率超70%,多数模型在30%左右;深度推理能力提升有助于识别任务,但对生成任务作用有限;多模态LLM在文本基空间任务中未体现明显优势;生成结果的风格相似性可作为模型相似度评估的新维度。局限性与未来方向:当前数据集规模较小、评估能力范围较