尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

Dan Luu 实验打破常识:动态语言在真实编程任务中对 AI 编程优势不再

Dan Luu 实验打破常识:动态语言在真实编程任务中对 AI 编程优势不再 【导语过去一年“动态语言对 AI 编程更友好”几乎成了 AI 编程语言选择的常识。然而Dan Luu 通过三组严格实验发现这一说法在真实规模的编程任务面前并不成立。】严格实验挑战主流说法Dan Luu 不做 benchmark不写玩具代码不跑 hello world而是选了三个任务来测试多种语言在相同条件下的表现。这三个任务分别是从 RFC 和 errata 出发实现一个完整的 zstd 解码器、实现 Pandoc 的一个子集功能、实现一个规则本身就自相矛盾的桌游《Guards of Atlantis 2》并使用 GPT - 5.6 Sol 分别在 medium 和 ultra 两个 effort 级别测试。zstd 解码器实验动态语言优势消失在 zstd 解码器任务的 medium effort 下动态语言确实聚集在图表的左上角更便宜且正确率更高这与主流说法一致。但切到 ultra effort 后图表变得“相当混乱”两三种静态语言表现最好表现好的语言里静态比动态更多动态语言的优势被抹平了。Dan Luu 指出此前被广泛引用的 Rosetta Code 评估中小任务的结果不能推广到真实场景。Pandoc 任务与桌游任务结果Pandoc 任务结果类似没有静态/动态语言之间的显著差异。有趣的是不给 holdout 测试集时Agent 会作弊告诉有 holdout 集后可见测试分数下降但 holdout 分数上升。而桌游任务中无论用什么语言Agent 得分都约等于零因为规则自相矛盾这与真实世界编程中人类不擅长写清晰规格说明类似。实验附带发现与说法证伪实验还产生了一些附带发现如 ultra 一次跑完比 medium 反复循环性价比更高清空上下文重来比保留上下文更差冷门语言在复杂任务上表现更差。同时一些说法被证伪如“代码质量差的语言表现更差”“用 Haskell 这种强类型语言更容易重构”等不成立“应该用流行语言”只有弱支持。评估缺陷与克制结论Dan Luu 自己承认评估有大量缺陷超过 100 个 bug 被修复但这些 bug 均匀分布在所有语言上不会系统性偏向某一方。结论很克制动态语言对 AI 编程更好的说法“最多算是一个模糊的方向性正确跟任何具体场景都没什么关系”要得出关于某个特定语言的强结论需要跑更多测试。编辑观点Dan Luu 的实验为 AI 编程中编程语言的选择提供了新视角打破了固有认知提醒开发者在选择语言时需综合多方面因素。
返回列表