梁文锋突袭马斯克!DeepSeek V4 Pro对战Grok 4.6,首测夯爆了
一边是梁文锋,终于在凌晨放出了DeepSeek V4 Pro正式版。
另一边,马斯克砸下了下一代旗舰Grok 4.6,主打一个成本低,性能强。
两大巨头,同一时间发布,火药味儿瞬间拉满。

他们盯上的,几乎是同一件事——
让模型能在长任务里持续调用工具、修改代码、验证结果,最后交付一个真正能用的成品。
DeepSeek V4 Pro来了
马斯克Grok 4.6出战
DeepSeek V4 Pro正式版最亮眼的成绩,是在两项评测中拿下绝对第一,直接反杀Fable 5。
网络安全智能体测试CyberGym拿到83.3分,超过Fable 5的83.1分、Opus 4.8的78.3分。
自动化任务AutomationBench拿到31.8分,把Fable 5的29.1分和Opus 4.8的27.2分一起压了下去。
最「贴脸」的一次,则发生在Terminal-Bench 2.1。
DeepSeek拿到87.9分,超过Opus 4.8的85.0分,距离Fable 5的88.0分,只差0.1。
其他几项高难度Agent测试中,DeepSeek则实现了对Opus 4.8的绝对跨越。
带工具的「人类最后考试」中拿到60.0分,反超Opus 4.8的57.9分,继续逼近Fable 5的63.0分。
就连此前最薄弱的软件工程智能体,DeepSWE也从预览版的12.8分暴涨到62.7分,接近原来的4.9倍。
这个成绩不仅超过Opus 4.8的58.0分,距离Fable 5的70.0分也只剩7.3分。

同一时间,马斯克也把Fable 5和GPT-5.6 Sol架在了火上烤。
Grok 4.6先是在综合能力上追平GPT-5.6,再在编码测试中连续完成反超。
综合智能指数上拿到61分,距离Fable 5的62分只差1分。
CursorBench上拿到69.9%,超过GPT-5.6的67.2%,距离Fable 5的70.5%只有0.6个百分点。
FrontierCode上拿到61.3%,也压过GPT-5.6的60.6%,继续紧追Fable 5的63.6%。
到了更接近真实职场交付的知识工作中,Grok 4.6直接翻身反杀,在三项评测中全部拿下第一。
GDPval-AA v2中拿到1753 Elo,超过Fable 5的1741,也超过GPT-5.6的1728。
AA-Briefcase上再拿1577 Elo,压过Fable 5的1574和GPT-5.6的1502。
专业法律任务Harvey LAB中拿到15.8%,Fable 5只有11.3%,GPT-5.6更是只有2.5%。

更狠的是,DeepSeek V4 Pro和Grok 4.6不仅在性能上直逼OpenAI和Anthropic的顶尖模型,还一起把前沿智能的价格打了下来。
每百万输出Token,Grok 4.6要6美元,GPT-5.6 Sol要30美元,Claude Opus 5要25美元,Fable 5要50美元。
而DeepSeek只要0.87美元——
约为Grok 4.6的1/7、GPT-5.6 Sol的1/35、Claude Opus 5的1/29、Fable 5的1/57!


全网首测
DeepSeek大战Grok
现在,第一批实测已经出炉。DeepSeek V4 Pro和Grok 4.6,也终于从跑分榜走进真实任务场。
第一轮,我们直接给DeepSeek上强度。
只用一条提示词,它便在浏览器中从零搭出了一颗完整的3D交互式地球。
拖动、旋转、缩放等基础交互全部可用;全球数据流、动态航线和地理标记,也被完整铺在地球表面。
再往细节看,大气层散射、云层渲染、昼夜光影乃至整套UI界面,同样一应俱全。

接下来,直接把两款模型拉进同一个擂台。
AI博主「向阳乔木」先用DeepSeek V4 Pro连跑三个小任务,随后又把其中两道题的相同提示词交给Grok 4.6,直接对比最终成品。
第一个任务,是调用3个Skill开发并部署一个网站。
DeepSeek顺利跑通了整套流程,从页面设计和完成度来看,整体表现非常稳定。
第二个任务,是一次复刻60种设计风格,并生成一整套Bento卡片集中展示。
这一轮,DeepSeek在字体、配色和版式上做出了明显区分,整体视觉效果相当不错。
最后一个任务,则是从零生成一款3D打砖块游戏。
游戏不仅可以直接上手,还加入了立体场景、背景音乐和动态音效,操作反馈和可玩性全部在线。



左右滑动查看
随后,相同的提示词被交给了Grok 4.6。
在3D打砖块这一局中,两款模型几乎打成平手。
Grok生成的游戏同样质感在线,无论视觉效果、场景完整度还是可玩性,都与DeepSeek V4 Pro不相上下。
到了60种Bento设计这一局,Grok 4.6则扳回一分。
它生成的部分页面,在排版、配色和视觉层次上更为成熟,最终效果也更加好看。


更激烈的对决,发生在Flappy Bird上。
开发者Jun Song给出完全相同的提示词,让DeepSeek V4 Pro和Grok 4.6分别从零「手搓」一款游戏。
结果,两款模型走出了截然不同的路线。
DeepSeek V4 Pro消耗超过2万Token,成本仅为0.019美元;Grok 4.6只使用约5000 Token,成本却达到0.03美元。

但从最终成品来看,这一局DeepSeek明显更胜一筹。
游戏中不仅有山脉远景和层叠云朵,水管也带有渐变与体积感。角色穿过水管时,画面甚至会弹出「+1」的浮动动画。
从场景层次到操作反馈,细节几乎全部拉满,端到端构建的完成度明显高于Grok 4.6。
在开发者Hamza进行的另一项前端测试中,DeepSeek V4 Pro再次拿下Grok 4.6。
无论页面完成度还是最终视觉效果,V4 Pro交出的成品都更胜一筹。

不过,V4 Pro也没有场场封神。
在一组鹈鹕对比测试中,相较于Flash版本,V4 Pro的整体画面完成度更高,大象的造型也更加美观。
唯一的问题是——鹈鹕的运动方向,被完全画反了。

继续增加难度,让DeepSeek V4 Pro、GPT-5.6 Sol和Claude Opus 5使用Three.js生成同一棵樱花树,差距就更加明显。
无论是树干与枝叶的细节,还是光影、景深和整体氛围,V4 Pro都不如另外两款顶尖模型。



DeepSeek V4 Pro;GPT-5.6 Sol;Claude Opus 5
几轮实测看下来,DeepSeek V4 Pro和Grok 4.6确实已经打到了同一水平线,难分伯仲。
两大AI同一天
追上了OpenAI和Anthropic
对于这两款模型的同时爆发,大佬Rick De Oliveira给出的评价是,「强大,而且实惠。」
这DeepSeek V4 Pro和Grok 4.6的加持下,这两个几乎不可能同时出现的词,在今天,第一次真正走到了一起。
从网络安全、知识型任务到Agent自主解决问题,它们已经在多个战场上,凭借着更低的成本直接击碎了前沿能力的天花板。

回看今天这场魔幻的AI「对轰」,DeepSeek与Grok共同改写了一条游戏规则:
顶尖智能,不再高不可攀。
过去,开发者往往只能在「用不起」和「不够强」之间艰难选择。
而今天,DeepSeek用仅为SOTA几十分之一的价格掀翻桌子,Grok则以极高的性价比紧随其后。
这场「高能低价」的正面冲击,已经撕开了旧秩序的裂口。

而战争还没有结束。
马斯克已经提前预告,Grok 4.7马上就来,目标直指超越所有顶尖AI;OpenAI与Anthropic的反击,也必将接踵而至。


身处这个以「小时」为单位进化的时代,智能不再是少数巨头的特权,属于所有人的应用大爆发,才刚刚开始。
参考资料:
https://api-docs.deepseek.com/zh-cn/quick_start/pricing/
https://x.ai/news/grok-4-6
https://x.com/vista8/status/2087577905081823559
https://x.com/vista8/status/2087566666477744620
https://x.com/jun_song/status/2087602149979254914
编辑:摩西 桃子
声明:本文转载自新智元,转载目的在于传递更多信息,并不代表本社区赞同其观点和对其真实性负责,本文只提供参考并不构成任何建议,若有版权等问题,点击这里查看更多信息!
AI 中文社