一夜之间,DeepSeek V4 Pro和Grok 4.6把全球大模型推入了新的斩杀线。


我人生第一次为Grok怒氪了300美元的SuperGrok Heavy会员。


雨露均沾了一下。
它们会继续负责最困难、绝对不能出任何差池的超大型任务,还有日常的所有办公任务、创意、内容生产,以及浏览器操控和电脑操控相关。
这就是我今晚重新分配完以后,暂时形成的模型组合。
因为我一直觉得,大模型其实存在一个很难同时满足的不可能三角。
性能。
价格。
速度。
如果你和我一样,每天接近十个小时的时候,几乎都在让各种Agent不停歇的干活,速度有时候就是一个至关重要的因素。
我现在其实已经快接受不了Codex用GPT-5.6 Sol正常模式的速度了。
一个任务十几分钟很常见,半小时起步也不稀奇,有些任务常年能干到一个小时。




聪明的,比如Claude Fable 5、GPT-5.6 Sol,经常是又贵又慢。
便宜的,速度确实经常也快,但是性能又经常差一截,比如DeepSeek V4 Flash,日常确实够用,但是对于我这种菜逼来说,我还是需要更强的模型能力来拔高我的上限。
按照目前定价,DeepSeek把Fable级Agent能力压到了百万输出Token 0.87美元,虽然之前发过涨价预告,不知道涨价完以后多少,但是我觉得应该超不过2美元。
而Grok 4.6更是把接近Fable 5的综合能力变成了2美元输入、6美元的输出价格,而且还给了我一个快到有点离谱的真实开发体验。
于是,新的斩杀线形成了,我把那个著名的大模型斩杀线的图补了这次的DeepSeek V4 Pro和Grok 4.6,DeepSeek V4 Pro的分因为还没出,我大概根据跑分,算了一下,估计就是56~58左右。


DeepSeek V4 Pro预览版只有72.1,正式版直接涨到了87.9,而Fable 5是88.0,只差0.1。
第二个,是DeepSWE。

DeepSeek从12.8一路冲到了62.7,一次涨了将近50分。
Fable 5是70分,所以DeepSeek依然有差距,可它已经从几乎干不了,还是大幅强化了很多,能干活一点了。
其他什么代码仓库理解、网络安全、自动化和工具调用,趋势也都差不多。
只要给它工具,让它真的开始操作环境,DeepSeek V4 Pro就会迅速逼近Fable 5,个别项目甚至还能超过。
但是它的短板也很清楚。
不使用工具,只考模型自身知识和推理时,它和Fable 5还会差十几分。碰到最困难的软件工程和复杂全栈任务,也依然会落后几分。
所以,我更愿意把它叫作Agent和Coding领域的准Fable级模型。
它在工具环境里的战斗力已经进了第一梯队,但是纯知识、困难软件工程、和超长期稳定性其实在我自己测试下来,也是感觉有点问题的。
特别还有个致命的点,就是还是没有多模态。
但是这个所谓的致命点,在如此离谱的价格和缓存命中率下,也不算啥了。
Fable 5的API价格,是百万输入Token 10美元,百万输出Token 50美元。
DeepSeek V4 Pro当前是百万输入Token 0.43美元,百万输出Token 0.87美元,缓存命中输入只有0.0036美元。
普通输入大约便宜23倍。
输出大约便宜57倍。
缓存命中输入的差距接近276倍,有一说一,DeepSeek的缓存技术实在是过于黑科技了,不仅便宜,命中率还极高。

这个价格,还挑个屁对吧,当然,前提是DeepSeek V4 pro不涨价,如果涨价不多的话,那未来搭配WorkBuddy,我觉得就是新一代的真神组合了。
我把DeepSeek V4 Pro直接接进Claude Code,实际跑了一些开发和Agent任务。
能力确实是不错,尤其是开发和工具调用,我能很明显感觉到它和预览版已经完全是两种状态了,预览版我其实吐槽过很多,现在至少是可以的,不开发大活你基本也分辨不出来啥区别。
这个模型,在经济价值上,直接就是新一代斩杀线了。
但是呢,问题就来了,那个不可能三角的定理还是在,就是DeepSeek V4 Pro实际开发速度,真的挺一般的。
尤其是当我同步在用Grok 4.6,那边都跑三任务了,这边一个还没跑完,这个速度的对比,还是挺强烈的。
不过如果你对任务的实时性和速度没有那么高的要求,或者跟我一样,就是跑异步自动化,那我觉得,这就是一个当今完美的模型。
以前我可能会习惯性把那些自动化任务任务全部挂在Codex上。
但是今天,我基本全切到DeepSeek V4 Pro了。
然后就是我的新宠,Grok 4.6。
讲道理,这是当今唯一一个,我觉得快把不可能三角拉满的,综合性能媲美Claude Fable 5,速度快到飞起,价格比DeepSeek这种价格屠夫要贵,但是相比现在OpenAI和Anthropic的旗舰模型,直接就砍了好几倍。

Grok 4.6的API起步价格,是百万输入Token 2美元、输出Token 6美元。
输入比Fable 5便宜5倍,输出便宜大约8.3倍。
虽然你看价格和性能跟Kimi K3差不多,但是这个价格,你不能这么算,因为,老马家是有订阅的。
我今天开了300刀的SuperGrok Heavy,而且现在还有活动,你订阅SuperGrok Heavy,还可以直接送你Cursor的价值200刀的Ultra会员。。。



我用Grok 4.6连续开发了大概四个小时,几乎没有碰到超过20分钟的任务。

有些任务甚至3分钟就结束了,而且不减质量。
这绝对是我用Codex时几乎从来没有体验过的速度。
过去一个任务跑十几分钟、半小时甚至一小时,我人都快被磨麻了,绝大多数的时间,都在等,而今天,我用Grok 4.6开发,居然久违的感受到了我跟Agent之间交互的感觉。
相信我,在很多时候,速度也会把模型的智力,真正变成生产力。

能力最强的,可以贵一点、慢一点。
能力弱一些的,可以靠低价抢用户。




