DeepSeek V4 Pro更新引热议:“斩杀线”下是惊喜还是虚晃一枪?
近日,人工智能领域因DeepSeek的最新动作掀起波澜。8月12日晚间,DeepSeek官网悄然更新API文档,将Pro模型版本号变更为DeepSeek-V4-Pro-0813。与此同时,第一财经援引DeepSeek官方群消息称,一组性能评分数据显示,V4 Pro正式版在多个测试集上表现远超预览版,尤其在Agent领域权威测试集Terminal Bench 2.1中,性能比肩当前最强模型Claude Fable 5。
在核心基准测试DeepSWE中,V4 Pro正式版得分飙升至62.7分,较预览版12.8分增长近5倍,而DSBench-Hard和DSBench-FullStack的得分也分别从31.1分、41.8分提升至67.2分、71.1分。硬件规格方面,V4 Pro延续MoE架构,总参数规模达1.6万亿,每次推理激活约490亿参数,提供100万token上下文和最高38.4万token输出,这一配置对长任务Agent至关重要,可避免因上下文窗口不足导致的记忆压缩问题。调用方式保持不变,老用户无需修改代码即可自动切换至新版本,价格方面,0813版每百万token缓存未命中输入3元、输出6元,与预览版持平。
DeepSeek V4系列的发布已引发行业连锁反应。自7月31日V4 Flash正式版上线后,AI模型市场出现“反常”降价潮。尽管GPU、内存、硬盘等硬件成本持续攀升,但OpenAI、Anthropic、谷歌等大厂纷纷下调模型价格。例如,OpenAI于7月30日将GPT-5.6 Luna输入价从每百万token 1美元砍至0.2美元,输出价从6美元降至1.2美元,降幅达80%。该公司称,通过优化生产推理内核,模型服务成本降低约20%,token生成效率提升15%以上,但这一解释难以完全匹配降价幅度。财务数据显示,OpenAI单季营收57亿美元,经营性亏损却高达93亿美元,市场预测其2026年全年亏损将达140亿美元。
其他厂商也采取类似策略。Anthropic将Claude Sonnet 5的优惠价格永久化,谷歌宣布Gemini Flash 3.6输出价永久下调17%。国内市场降价幅度更为激进,智谱重置GLM Coding Plan全员额度并叠加1.5倍限时加成,火山引擎为GLM-5.2提供四倍折扣,OpenRouter上三家供应商甚至将GLM-5.2价格压至原价的5%。然而,真正站在金字塔尖的旗舰模型如GPT-5.6 Sol、Kimi K3、Claude Fable 5并未降价,它们凭借复杂推理、长链路任务等硬核能力维持溢价。以Kimi K3为例,其国内版输入输出价格较上一代分别上涨208%和270%,但Artificial Analysis智能指数显示,V4 Flash得分仅50分,明显低于头部模型。
行业观察人士指出,DeepSeek的“斩杀线”效应源于技术突破。2026年6月,DeepSeek发布DSpark推测解码模块,通过小模型快速生成草稿、大模型并行验证修正的方式,将单用户生成速度提升60%至85%,有效推理成本降至原来的1/3至1/5。这一技术逐渐成熟后,越来越多厂商开始部署类似方案。静态知识剥离技术也在降低模型成本方面发挥潜力。该技术由meta AI团队于2020年提出,通过将事实性知识从参数中剥离、依赖外部检索补充,既加快思考速度又减少幻觉输出。DeepSeek联合北大提出的Engram技术进一步优化这一逻辑,使模型能专注于组合推理等核心任务。
尽管V4 Pro性能提升显著,但其发布真实性却引发质疑。与V4 Flash正式版有完整更新日志、明确标注模型结构细节不同,V4 Pro的发布痕迹仅限于官网“模型&价格”页面、首页滚动公告及一张跑分表。权威评测机构Artificial Analysis显示,V4 Pro 0813版综合智能指数为53分,虽高于预览版的45分,但与Fable 5存在差距,甚至低于同日发布的Grok 4.6的61分。在数学能力测试Proof Bench中,V4 Pro也未挤入前十。个人评测者反馈,V4 Pro在长程AgenticCoding任务中存在早停现象,实测效果不及GLM-5.1。
有分析认为,0813版本号可能是“占位符”,DeepSeek或未直接上线新模型,而是为后续发布预留空间。此前,DeepSeek Harness负责人崔添翼透露,V4 Pro正式版将与DeepSeek Harness同步上线,而8月13日恰为Harness最后一次测试日。内测群消息显示,0813版本计划发布Harness公测版,该工具在V4 Flash测试中已展现强大能力。例如,V4 Flash正式版在Terminal Bench 2.1中取得的82.7分,实为“模型+Harness框架”的组合成绩,高于预览版的61.8分。一旦Harness与V4 Pro正式版结合,可能形成新的行业标杆。
国内厂商已加速布局这一赛道。除DeepSeek外,智谱推出针对GLM的ZCode框架,上线Goal、Subagents等四大功能。在智谱自研Code Bench中,GLM-5.2配合ZCode的复杂跨文件任务通过率比配合Claude Code高出2.39%,缓存命中率超98%,有效token量提升约30%。这场由技术突破引发的降价潮,正重塑AI模型市场的竞争格局。
