尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

Opus 5性能更强但使用体验不如Opus 4.7、4.8和Fable,原因何在?

Opus 5性能更强但使用体验不如Opus 4.7、4.8和Fable,原因何在? 为什么使用Opus 5的体验更差发布于2026年8月14日。在我和交流过的同事看来与Opus 4.7、Opus 4.8以及Fable相比使用Opus 5的体验似乎变差了。虽说它的性能并未退步实际上Opus 5比Opus 4.7和Opus 4.8更强大在基准测试中甚至能和Fable抗衡。然而使用其他这些模型的体验却更好。我觉得这是因为它们具备以下优点当我的意图不明确时会停下来询问不会在未核实的情况下做出假设不会在未征求意见的情况下重新解读或更改我的计划。所以使用它们时不用像使用Opus 5那样小心翼翼地监督。无端猜测我怀疑这是Anthropic以及当前前沿实验室普遍存在的两种因素共同作用的结果。其一人们渴望创建一个能够自我改进的AI使其能够通过递归方式不断提升最终达到通用人工智能AGI或超级人工智能ASI的水平。其二存在在基准测试中取得高分的压力。尽管很多人都清楚许多基准测试任务定义不明确、不公平、可被破解或存在其他问题但一个好的基准测试任务是自包含的它是可以解决的不需要提示、揣测任务设计者的意图或借助外部信息就能完成。这并非意味着一个好的任务只能有一个正确答案而是应该对所有明确正确的答案给予同等的评分。选择在基准测试中表现出色的模型实际上针对基准测试进行训练或进行基于奖励的强化学习RLVR任务训练本质上就是在选择那些在面对模糊情况时敢于大胆做出通常正确假设的模型而会惩罚那些倾向于停下来寻求澄清或指导的模型。可惜的是这恰恰是我们大多数人对代码编写助手的期望。无论你多么努力几乎不可能将所有的背景信息、意图、业务影响、预算限制等内容都记录下来并让代码编写助手获取。不可避免地会存在模糊性和需要做出的选择而知道助手在需要时会停下来询问这是非常好的。现实生活并非基准测试并非每个问题都有确定的正确答案甚至可能没有一组正确答案。考虑到现实生活中的后果我可不想让助手仅凭猜测行事
返回列表