梁文锋与马斯克AI战场“交锋”:模型、智能体、算力三大领域激战正酣
AI领域正上演一场备受瞩目的巅峰对决,主角分别是DeepSeek创始人梁文锋与科技巨头马斯克。近期,DeepSeek V4-Pro与马斯克旗下SpaceXAI推出的Grok 4.6几乎同时亮相,瞬间点燃了AI行业的竞争烽火。
DeepSeek V4-Pro的发布历程充满波折。从4月24日预览版首次现身,到8月中旬正式版本落地,中间历经多次延期。8月12日夜间,该模型先在API文档中悄然上线,然而官网横幅和公告却很快“诡异”消失,直到次日19时19分,才通过公众号正式官宣。而几乎同一时刻,Grok 4.6也强势登场,两款SOTA模型自此开启了同台竞争的激烈局面。
在性能比拼方面,两款模型各有千秋。DeepSeek V4-Pro在AI安全(Cybergym)和工作流自动化(AutomationBench)等特定领域展现出独特优势,其速度优势明显,在相同提示词下,完成任务用时仅为Grok 4.6的一半,视觉效果也超出预期。不过,也有用户实测发现,DeepSeek V4-Pro存在一些问题,比如靠近视线处水面波纹表现不佳,帆船随波浪前行的轨迹不够自然。Artifical Analysis Intelligence Index的测评结果显示,V4-Pro得分为53分,仅比Flash版本提高1分,引发部分用户不满。Grok 4.6则在综合智能指数(Artificial Analysis)和软件工程(DeepSWE)等测试中表现更为出色,在真实世界专业任务评测GDPVal-AA v2中拿到1753 Elo,高于Claude Fable 5 Max的1741分,Artificial Analysis Intelligence Index达到61。Grok 4.6在成本效率上优势显著。
定价策略上,两款模型差异明显。DeepSeek V4-Pro当前定价为输入0.43美元/百万Tokens,输出0.87美元/百万Tokens,缓存命中输入仅0.0036美元。与Claude Fable 5相比,其普通输入便宜23倍,输出便宜57倍。Grok 4.6输入2美元/百万Tokens,比Fable 5便宜5倍;输出6美元/百万Tokens,比Fable 5便宜8倍多。将二者横向对比,输入侧Grok 4.6单价约为DeepSeek V4-Pro的4.7倍,输出侧价格达到近7倍。不过,DeepSeek宣布自8月17日起,随着V4全系列模型正式版上线,将对API价格进行更新调整,采用峰谷定价,空闲时段价格为高峰时段价格的一半。调整后,以高峰时段对比,DeepSeek-V4 Pro缓存命中输入涨至12倍,未命中输入涨至3倍,输出涨至4.5倍,涨价后其在高峰期的性价比优势不再明显。而且,开发平台Composio对两个模型进行30项高难度智能体任务对比测评,结果显示Grok在通过率、速度和成本方面均优于DeepSeek。
智能体领域成为这场对决的激烈战场。DeepSeek在正式发布V4-Pro的同时,面向全球开发者开放DeepSeek Harness开发者预览版(v0.1)。Harness是DeepSeek于今年5月组建的代码智能体团队,目标是开发对标Anthropic Claude Code的桌面端智能体编程产品。不少内测用户称,Harness内置多种子智能体和工作流能力,能自主完成需求理解、代码生成、调试修复等多步骤任务。用户可根据任务复杂度,在会话开始时为模型选择不同的“Agent预设”。几乎同一时间,SpaceXAI推出人工智能软件“Grok Bot”,这是一个全天候在线的智能助手团队,可接受并完成用户分配的实际工作任务。Grok Bot最初是内部原型,在公司内部迅速普及,用于处理销售外呼、市场营销活动、办公室日常运营、漏洞修复等。目前,Grok Bot处于测试阶段,面向Windows、iOS等平台上的SuperGrok Heavy、Cursor Ultra和Cursor Teams订阅用户开放。DeepSeek Harness和Grok Bot路线截然不同,前者面向开发者,核心场景是编程;后者面向想用AI提效的普通人。实测发现,用DeepSeek Harness重构网页仅需消耗3元,但长程任务中响应速度偏慢,需多轮交互,更擅长长文本、多步骤任务的资源优化;Grok Bot响应速度快,但token成本高于Harness,长文本场景下总成本可能更高。
算力竞争是这场对决的终极较量,也是决定谁能走得更远的关键因素。几乎所有模型公司都面临算力不足的问题,月之暗面旗下的Kimi K3因算力逼近集群承载极限,上线48小时便暂停订阅;DeepSeek也因激增的用户规模和算力扩容严重错位,频繁出现服务中断。梁文锋曾表示,DeepSeek目前拥有约两万张H100等效算力,落后美国12到18个月,国产算力卡可用数量仅一万六千张,难以支撑超大参数模型的完整训练迭代。受算力限制,DeepSeek在技术路线选择上更注重极致工程优化,DeepSeek V3训练成本不到560万美元。为解决算力问题,DeepSeek已完成A轮510亿融资,新一轮融资也在推进,梁文锋曾在投资者会上直言,融资要“尽快换成GPU”,若市场允许,2026年采购200亿元算力也在考虑范围内。相比之下,马斯克在算力储备上优势巨大。Grok 4.5由数万块NVIDIA GB300 GPU训练而成,其背后的Colossus超算集群总算力规模2024年约20万张H100 GPU,是DeepSeek H100等效算力的10倍。Colossus首批10万块GPU超算集群从启动到上线仅用122天,展现了强大的“钞能力”和执行力。在Grok 4.6发布前两周,马斯克在“X”平台上关注了DeepSeek的官方账号,旗下Grok也承认将DeepSeek列入了“必须紧盯的对手名单”。
这场激烈的贴身肉搏之战仍在持续。马斯克明确表示Grok 4.7将在数周后推出,参数规模预计达到2.1万亿,目标“超越所有目前的模型”。而梁文锋也始终在追逐AGI(通用人工智能)的道路上坚定前行。从模型性能到智能体应用,再到算力储备,马斯克和梁文锋的对决精彩纷呈,尚未分出胜负。
