DeepSeek
DeepSeek V4-Pro正式版悄然上线,这款被官方称为“更会把一件事干完”的模型,在软件工程智能体能力上实现了近4.9倍的提升。与以往高调发布不同,此次新版本直接出现在API文档中,未举办任何发布会或官宣活动,却因显著的性能提升和价格调整引发关注。
在参数配置上,V4-Pro支持1M上下文长度,输出上限扩展至384K Token,并引入thinking和non-thinking双模式,默认开启思考模式。其接口同时兼容OpenAI和Anthropic两套格式,可无缝接入Claude Code等Agent框架。价格方面,V4-Pro定位高端市场,缓存命中输入0.025元/M token,未命中输入和输出分别达3元和6元,较V4-Flash版本涨幅明显,其中输出价格直接翻三倍。
官方数据强调,V4-Pro的测试重点从“答题能力”转向“持续干活能力”。九项Agent与代码基准测试显示,Terminal Bench 2.1(终端操作)得分87.9,Cybergym(网络安全)提升至83.3,NL2Repo(自然语言转代码仓库)达61.5,DeepSWE(软件工程)增长至62.7,较Preview版本均有显著提升。不过,社区开发者指出,其部分基准表现仍落后于Luna MX和Kimi K3,官方尚未发布完整benchmark报告,数据真实性需第三方验证。
为验证官方说法,测试团队采用最新复杂手法,将V4-Pro接入Claude Code的Anthropic兼容接口,在真实Agent环境中完成7项任务,涵盖从基础SVG生成到长周期工程开发。首项测试“鹈鹕骑自行车”中,模型生成画面出现结构错误,如踏板脱离自行车、云朵反向等,即便调整推理强度仍未改善。类似问题也出现在“老水手夜晚等船”动画测试中,月亮绘制明显出错,与模型整体能力形成反差。
尽管存在低级失误,V4-Pro在其他任务中表现亮眼。在“60种风格Bento卡片墙”测试中,模型一次性生成60种差异显著的设计风格,严格执行不规则拼贴要求,无任何敷衍的“换色卡”。前端动画叙事任务中,它根据文字描述完成自动循环动画,镜头推进和情绪表达到位,文字排版与场景动态融合。Three.js 3D打砖块游戏测试中,游戏机制闭环、碰撞准确、UI和手感兼备,配色摆脱“AI感”,进入顶级模型行列。
压轴测试“React Three Fiber 3D浮岛创意作品集网站”中,V4-Pro耗时1.5小时完成滚动驱动相机、四章节叙事、物件交互等复杂要求,首轮交付即0 bug运行,转场、运镜、交互和移动端适配表现极佳,仅初始界面过曝。对比此前测试的GPT-5.6、Kimi K3和V4-Flash-0731,V4-Pro在运镜、转场和交互上实现全面升级。
长周期工程测试中,V4-Pro从零搭建记账本全栈应用,连续完成三轮迭代,包括记账核心功能、月度分类统计和预算提醒。每轮均真实运行测试,不通过则自行修复bug,全程无需人工介入,仅在新建文件时申请权限。这种“踏实做事”的风格,凸显其接住用户需求的能力。
尽管存在鹈鹕和月亮等低级失误,V4-Pro在前端审美、创意任务和长周期工程上的表现,已使其跻身顶级模型行列。与Grok 4.6几乎同步发布,两者均采用超高性价比定价策略,这场开源与闭源模型的对决,或比官方数据更能反映市场趋势。在AI大模型集体转向高性能、高价值的背景下,V4-Pro的涨价策略仍被认为极具竞争力,免费午餐的时代正在远去。
