
魔幻对轰两大巨头同日发布模型今天这场AI对决太魔幻了一边是梁文锋在凌晨放出了DeepSeek V4 Pro正式版另一边马斯克砸下了下一代旗舰Grok 4.6主打成本低、性能强。两大巨头同一时间发布火药味儿瞬间拉满。他们盯上的是同一件事——让模型能在长任务里持续调用工具、修改代码、验证结果最后交付一个真正能用的成品。性能比拼各有亮点直逼顶尖DeepSeek V4 Pro正式版成绩亮眼在两项评测中拿下绝对第一反杀Fable 5。网络安全智能体测试CyberGym拿到83.3分超过Fable 5的83.1分、Opus 4.8的78.3分自动化任务AutomationBench拿到31.8分压过Fable 5的29.1分和Opus 4.8的27.2分。在Terminal - Bench 2.1中DeepSeek拿到87.9分距Fable 5只差0.1分在其他高难度Agent测试中也实现了对Opus 4.8的绝对跨越。就连此前最薄弱的软件工程智能体DeepSWE成绩也从预览版的12.8分暴涨到62.7分。同一时间马斯克的Grok 4.6也表现出色。它先是在综合能力上追平GPT - 5.6再在编码测试中连续反超。综合智能指数上拿到61分距Fable 5只差1分CursorBench上拿到69.9%超过GPT - 5.6FrontierCode上拿到61.3%压过GPT - 5.6。在更接近真实职场交付的知识工作中Grok 4.6在三项评测中全部拿下第一。更厉害的是DeepSeek V4 Pro和Grok 4.6不仅性能直逼OpenAI和Anthropic的顶尖模型还把前沿智能的价格打了下来。每百万输出TokenGrok 4.6要6美元GPT - 5.6 Sol要30美元Claude Opus 5要25美元Fable 5要50美元而DeepSeek只要0.87美元。实测对决难分伯仲各有胜负现在第一批实测出炉DeepSeek V4 Pro和Grok 4.6从跑分榜走进真实任务场。第一轮给DeepSeek上强度它只用一条提示词就在浏览器中从零搭出了完整的3D交互式地球细节一应俱全。AI博主「向阳乔木」把两款模型拉进同一个擂台对比。第一个任务DeepSeek顺利完成调用3个Skill开发并部署网站的流程表现稳定第二个任务DeepSeek复刻60种设计风格生成Bento卡片集视觉效果不错第三个任务DeepSeek从零生成3D打砖块游戏可玩性在线。Grok 4.6在3D打砖块游戏中与DeepSeek V4 Pro平手在60种Bento设计中扳回一分生成的部分页面效果更好。在Flappy Bird游戏对决中两款模型路线不同。DeepSeek V4 Pro消耗超过2万Token成本仅0.019美元Grok 4.6只使用约5000 Token成本却达0.03美元。但从最终成品看DeepSeek更胜一筹细节拉满。在开发者Hamza的前端测试中DeepSeek V4 Pro再次获胜。不过V4 Pro也有失误在鹈鹕对比测试中画反了鹈鹕运动方向在生成樱花树的测试中也不如另外两款顶尖模型。改写规则智能不再高不可攀几轮实测下来DeepSeek V4 Pro和Grok 4.6打到了同一水平线难分伯仲。大佬Rick De Oliveira评价它们「强大而且实惠」这两个几乎不可能同时出现的词在这两款模型的加持下走到了一起。从多个战场来看它们凭借更低的成本击碎了前沿能力的天花板。过去开发者只能在「用不起」和「不够强」之间选择而今天DeepSeek用低价掀翻桌子Grok紧随其后。这场「高能低价」的冲击撕开了旧秩序的裂口。战争还未结束马斯克预告Grok 4.7马上就来目标超越所有顶尖AIOpenAI与Anthropic的反击也必将到来。身处这个快速进化的时代智能不再是少数巨头的特权属于所有人的应用大爆发才刚刚开始。这两款模型的未来究竟会如何发展谁又能在后续的竞争中脱颖而出呢