AI圈过年!xAI和DeepSeek同时发布Fable级别新模型
今天凌晨,DeepSeek V4 Pro正式版终于发布,与此同时,Grok 4.6也正式发布。
AI大模型的世界再次卷起来了,因为这两个模型有着逼近Claude Fable 5的体验。
可怕的是,这距离Fable 5的发布也不过才两个月。
先说DeepSeek V4 Pro。
说到DeepSeek就绕不开它的价格。
V4 Pro的缓存命中费用为每百万token 0.025元,缓存未命中(输入)费用为3元,缓存未命中(输出)费用为6元。
相比之下,Flash的相应费用分别为0.02元、1元和2元,这意味着Pro在缓存未命中(输入和输出)方面的成本大约是Flash的三倍。
好一个量大管饱。
作为对比,Fable 5的API价格,是百万输入Token 10美元,百万输出Token 50美元。
把DeepSeek V4 Pro的API价格换算一下,当前是百万输入Token 0.43美元,百万输出Token 0.87美元,缓存命中输入只有0.0036美元。
与Fable 5相比,缓存命中输入的差距接近276倍。
无需多说。
当然,DeepSeek V4 Pro要是涨价那就另说。之前DeepSeek就表示过,近期会有一次价格上调。
再看DeepSeek V4 Pro的跑分。
Terminal Bench 2.1:87.9。Agent要在真实终端环境里调试代码、配置系统、处理安全和科学计算任务。DeepSeek与Kimi K3的88.3、Fable 5的88.0已经非常接近,说明终端执行能力进入第一梯队。
Agents’ Last Exam:25.7。 它测是跨行业、长周期、可验证的真实专业工作。DeepSeek与Opus 4.8持平,高于GLM-5.2,但低于Kimi-K3。
DSBench-Hard:67.2。 这是DeepSeek内部的高难度Coding Agent测试集。相比Opus 4.8的71.7仍差4.5分,说明极端复杂任务还有距离;但因为测试集未完全公开,这项成绩只能作为辅助证据。
再配合上工具,在性价比这方面,你DeepSeek叔叔真是不可小觑。
要说缺点,老生常谈的问题,还是没有多模态,其次就是速度并不快。
总体来看,DeepSeek V4 Pro凭借着超高性价比与不错的实力进入大模型前列,但与头部仍有差距。
再说Grok 4.6。
表现可以称得上惊艳,纸面跑分逼近Fable 5。
Grok 4.6价格不变,还是百万输入Token 2美元、输出Token 6美元。
和Fable 5相比,输入便宜5倍,输出便宜约8.3倍。
价格上虽然不能和DeepSeek比,但Grok 4.6不仅比Opus 5和GPT-5.6 Sol 版本更便宜,甚至比Sonnet 5还要便宜。
性能上,这次升级重点在后训练(更强的SFT + RL)、长程Agent 能力、多步推理和交互/视觉任务上。遗憾的是对于长程任务很重要的上下文窗口没有升级,还是500k 。
在实际开发中,Grok 4.6在速度的表现也让人感到惊喜。
X上一位开发者,用DeepSeek V4 Pro和Grok 4.6跑同样的任务,结果发现,Grok 4.6都跑完三个任务了,DeepSeek V4 Pro一个还没跑完。
同时,Grok 4.6在涉及智能任务、终端使用以及客户服务的评估中得到高分。
在GDPval-AA v2、³-Banking以及Terminal-Bench v2.1这些评估中,Grok 4.6的表现与其他所有模型相当甚至超过了Claude Opus 5。
别的不说,就想问谷歌Gemini还能坐得住吗?
马斯克更是豪言“Grok 4.7将超越所有当前模型。”
马斯克同时表示,Grok 4.7将在3到4周内准备就绪。
我相信,不管是哪家公司,下一次颠覆绝对不会让人等太久。
两个月前大家还在为Claude Fable 5惊呼,如今逼近Fable 5的模型层出不穷。
而对于全球开发者而言,这无疑是最好的时代。
