AI领域双雄争霸:DeepSeek V4 Pro与Grok 4.6同日登场,实测难分伯仲
人工智能领域迎来一场前所未有的激烈碰撞。两大科技势力同日推出新一代模型,DeepSeek V4 Pro与马斯克旗下Grok 4.6展开正面交锋,在性能与成本维度同时向行业巨头发起挑战。
在多项权威评测中,DeepSeek V4 Pro展现出惊人实力。网络安全智能体测试CyberGym中,该模型以83.3分超越Fable 5的83.1分;自动化任务基准AutomationBench上,31.8分的成绩将竞争对手甩在身后。最引人注目的是Terminal-Bench 2.1测试,0.1分的微弱差距使其与Fable 5的榜首位置仅一步之遥。软件工程领域更实现质的飞跃,预览版12.8分的成绩暴涨至62.7分,展现出惊人的迭代速度。
马斯克阵营的Grok 4.6同样来势汹汹。综合智能指数达到61分,与Fable 5仅差1分;编码测试CursorBench中,69.9%的准确率超越GPT-5.6的67.2%。在更贴近实际工作场景的知识型任务评测中,该模型展现统治力:GDPval-AA v2、AA-Briefcase两项测试均登顶榜首,专业法律任务Harvey LAB中15.8%的得分,将竞争对手远远抛在身后。
价格战成为这场技术对决的另一焦点。Grok 4.6将每百万输出Token价格压至6美元,仅为GPT-5.6 Sol的1/5。DeepSeek则祭出更具冲击力的定价策略,0.87美元的价格相当于Grok 4.6的1/7,较行业平均水平降低超过90%。这种颠覆性的定价模式,直接动摇现有商业模型的根基。
首批实测数据揭示出更复杂的竞争格局。在3D交互式地球构建任务中,DeepSeek仅用单条提示词就完成从零搭建,全球数据流、动态航线等复杂功能一应俱全。当两款模型正面交锋时,Grok 4.6在60种Bento设计任务中展现更成熟的视觉层次,而DeepSeek则在3D打砖块游戏开发中,凭借更丰富的场景细节和操作反馈赢得开发者青睐。
成本效率的较量同样激烈。Flappy Bird游戏开发测试显示,DeepSeek消耗2万Token完成高完成度作品,成本仅为0.019美元;Grok 4.6虽使用5000 Token,但成本达到0.03美元。不过在樱花树生成任务中,GPT-5.6 Sol和Claude Opus 5在光影效果和细节呈现上仍保持优势,暴露出新兴模型在复杂图形处理领域的短板。
这场技术风暴正在重塑行业生态。开发者首次在性能与成本之间获得双重选择权,过去"用不起"或"不够强"的困境被彻底打破。据内部人士透露,马斯克团队已启动Grok 4.7研发计划,目标直指全面超越现有所有模型。而OpenAI与Anthropic的应对策略,或将引发新一轮技术军备竞赛。
在这场没有硝烟的战争中,技术突破与商业策略的双重博弈正在上演。当顶尖智能突破价格壁垒,人工智能的应用边界将如何拓展?行业格局的剧变或许才刚刚拉开序幕。
