DeepSeek V4 Pro正式登场:能力跃升价格亲民,AI竞争新阶段启幕
人工智能领域迎来重要进展,DeepSeek旗下V4 Pro模型正式版本悄然上线。此次更新未提前发布预告,仅通过官网API文档的细微变动传递信息,却在开发者社区引发广泛关注。该模型自4月24日预览版发布以来,历经111天密集优化,最终完成关键能力升级。
核心升级聚焦于代码处理与多模态能力。在软件工程基准测试中,新版本在DeepSWE指标上从12.8跃升至62.7,Cybergym得分提升至83.3,Terminal Bench达到87.9,DSBench-Hard更是实现翻倍增长。这些突破性表现集中在复杂代码修改、环境交互和工具调用等场景,恰好弥补了预览版在此类任务中的短板。多模态支持成为另一亮点,原生图像推理功能使模型能够同步处理图文混合内容,为需要视觉理解的智能体应用开辟新可能。
定价策略延续预览版标准,每百万输入token收费3元,输出token收费6元。尽管官方已预告即将上调API价格,但当前版本仍维持原有费率。这种"加量不加价"的策略,在同类产品中形成显著竞争优势。对比市场数据,其价格约为Fable 5的十分之一,Kimi K3的三分之一,这种性价比优势在智能体能力大幅提升后更具市场冲击力。
实际测试验证了模型升级成效。在Boids群体模拟任务中,模型仅用170秒生成761行完整代码,实现200个三角形的动态行为模拟,包含物理碰撞、参数调节和交互界面等复杂功能。番茄钟开发测试中,面对模糊需求,模型自主添加任务标签、统计图表和白噪音合成等增值功能,展现出更强的产品化思维能力。不过在寻路算法可视化测试中暴露出新特性:启用思考模式时,推理token消耗占比超80%,导致代码输出被截断,这一现象提示开发者需根据任务类型调整参数配置。
性能对比显示,新版本在HLE工具使用、NL2Repo等基准测试中仍落后于Claude Opus 4.8和Fable 5等头部模型。但DeepSeek的差异化竞争策略正在显现成效,其通过"高性能+低成本"的组合,在智能体应用场景中构建起独特优势。值得关注的是,官方更新日志中提及的"DeepSeek Harness极简模式"暗示着更大布局,这个即将发布的智能体运行框架,可能将模型能力与工具链进行深度整合,推动AI应用从单一功能向系统化解决方案演进。
当前开发者社区正围绕新版本展开密集测试,其在代码生成质量、多模态理解和成本控制方面的平衡表现,引发关于AI技术落地路径的新讨论。随着智能体框架的即将发布,行业竞争焦点正从模型性能比拼转向系统化解决方案的构建,这或许将重新定义人工智能产品的价值评估标准。
