Hy4 preview上线!“在线考核”姚顺雨的新作业丨附实测案例

文丨苏扬
编辑丨徐青阳
8月28日,姚顺雨又交作业了,这一次是混元Hy4 preview。
混元Hy4 preview,总参数770B,相比前一代产品Hy3 的295B,有了大幅度的提升。770B的Hy4 preview激活参数为49B,也同样实现了翻倍,并且实现了100万的上下文长度。
概括来说,Hy4 preview在尺寸、上下文长度、数据规模上进行了全面的扩展,“在代码、办公、科学等生产力任务上展现出卓越能力。”腾讯混元团队在新闻稿中透露。
01
智力代际跃迁
基于上述提升,Hy4 preview在包括Terminal Bench 2.1、DeepSWE等在内的12项基准测试中,在前一代Hy3的基础上,可以说实现了代际飞跃。

Hy4 preview基准测试表现
尤其是在聚焦终端命令行编程的Terminal Bench 2.1中,Hy4 preview拿下85.4的高分,与Hy3的分差拉到了14.6分,成功超越DeepSeek V4 Pro,并且与Claude Opus 5得分持平,跻身该项测试的第一梯队。
另外,在聚焦软件工程实战的DeepSWE测试中,Hy4 preview实现巨大跨越,从Hy3的28.0翻到64.3,逐步缩小与一线模型之间的差距。
也就是说,姚顺雨的新作业,不仅核心聚焦在“写代码、修代码”这件事情上,并且在提升幅度上,相比前代模型表现得非常激进。
腾讯混元团队透露,Hy4 preview 定位“为生产力而生”的模型。
在Toolathlon-Verified(工具调用马拉松)的测试中,拿到了74.1的高分,超越千问 3.8 Max、GPT-5.6 Sol等,并且逐步逼近Kimi K3和Opus 5。而在测试智能体一次性成功率的APEX-Agents(pass@1) 中,Hy4 preview也拿到了37.1分,紧追37.2分的Kimi K3。
在腾讯内部组织的163名内部专家、203个WorkBuddy环境下工程任务的盲测中, Hy4 preview(均分2.99/4.00)略优于 GLM 5.3(均分2.92/4.00) 和 Kimi K3(均分2.94/4.00)。
如果我们把整个12项基准测试全部放在一起,你会发现一个现象:Hy4 preview每一项测试都不是最低的。要知道,它的总参数和激活参数也只有770B、49B,远不及上述第一梯队中的“竞争对手”。
这个角度看Hy4 preview的进步是巨大的。当然,进步没有掩盖现在preview版本的不足,比如多模态能力的缺失。现在,Hy4 preview还无法支持视觉,这需要在后续的正式版当中来补齐。
能力大幅提升,价格依旧维持在低水平。
“Hy4 preview 继续走普惠的高性价比路线。”腾讯混元团队表示。根据公布的价格信息,Hy4 preview 输入6元/百万tokens,输出18元/百万tokens,缓存命中0.3 元/百万tokens。
目前,Hy4 preview已经开源,并在WorkBuddy/CodeBuddy国内版及国际版、元宝、ima等腾讯产品同步首发,可直接通过产品体验,还可以通过腾讯云Tokenhub和OpenRouter接入API使用。
02
聪明且“慢热”
基准测试分数只能粗略反映能力,效果还要靠demo说话。
根据腾讯混元团队的介绍,在软件工程场景下,模型增强了长程开发任务的理解、规划、调试与验证能力,进一步提升前端开发的视觉审美和交互质量。
我们在WorkBuddy上接入了混元模型后,让它做了一个谷歌财报的页面,提示词为“我想做一个谷歌财报的页面,请你帮我设计一下,要求有财报的新闻稿,分季度的入口。”
虽然需求很明确,但提示词并没有强调数据从哪里找、页面如何布局,交互如何设计等等,所以这些问题都需要Hy4 preview自行解决。在经过17分钟的执行之后,它交付了一个结构清晰、文字、表格、图形都有的汇总页面,并且对一些核心数据做了注释和划重点。

谷歌母公司财报汇总页
关于数据的来源,它找的是SEC和谷歌的IR资料包,也就是说它是可以判断信源的可靠性的。并且还会对互联网上的报道进行交叉验证,然后运行工具来校验数据,最后都确认可靠的情况下,再去写代码。

Hy4 preview执行任务过程中的“思考”
也就是说,它做的并非某一项单一环节的工作,而是同时承担了研究员、前端工程师的角色。
腾讯混元团队还在新闻稿中表示,Hy4 preview在科学研究场景下,显著提升复杂科研问题的理解、推理与求解能力,模型在 AI 研发、分子动力学模拟、凝聚态物理、基础数学等各类场景中均有长足进步。
所以我也让它做了一款火星模拟器,除了拿不到火星的实体照片之外,基础的交互非常的清晰,包括核心的地标,对应的详细信息,以及特定的操作控件,比如图层、自转、时间等等,整个前端的效果非常超预期。

火星探索者模拟器。提示词:帮我参考google earth 制作一个火星的科普模型

火星模拟器升级成太阳系模拟器 提示词:能否把太阳系的八大行星独立的模型都做出来,并且制作一个整个太阳系八大行星的模型,类似于分层的概念,我可以在八大行星中科普漫游,但要严格对照科学数据,尤其是比例,还是信息的准确性。
现在很多模型也都会强调自己的游戏开发能力,我们也测试了Hy4 preview的这项能力,让它做了一个限时收集的3D小游戏,从交付的结果来看,基本的操作交互都有,画面也是卡通风格,符合小游戏的调性。
但如果从整个游戏行业的水平来看, 它还做不到所谓3A制作的能力。而且,让现阶段的模型来做3A作品,预期反而过高了。

企鹅岛小游戏。提示词:做一个可以直接玩的 3D 小游戏:玩家控制一只企鹅,在不断破裂和漂移的冰面上坚持 90 秒,同时收集鱼,躲避海豹。随着时间推移,冰面越来越少,游戏难度逐渐增加。要求:必须有明确的开始、失败、胜利和重新开始流程;有分数、倒计时和难度递增;玩家操作要有明显反馈,包括移动、碰撞、收集和受伤反馈;场景不能只是简单几何体堆砌,要有基本的视觉完整度;自行测试游戏是否真的可以从头玩到结束;如果环境支持游戏引擎,可以自行选择合适引擎完成。不需要先给我设计方案,直接做出可玩的版本。
不过,在多个demo的测试中,我们也发现Hy4 preview有些“慢热”,眼看要出结果了,但模型会反复的验证,导致给用户交付结果的时长过长,等待结果也是一个比较“煎熬”的过程。
腾讯混元团队表示,Hy4 preview是Hy4迭代的一个早期版本,预训练和后训练均仍有较大的提升空间,也有一些已知问题,如复杂任务的长思考和过度自我验证倾向。如同Hy3 preview,我们希望通过Hy4 preview的尽快发布获得广泛的真实反馈,从而显著提升Hy4正式版。
03
混元越来越快了
自2月重建基础设施以来,混元大模型平均每两个月迭代一次大版本。
除了Hy3 preview、Hy3和Hy4 preview,背后其实有大量外界看不到的基础设施、组织相关的工作。从这个角度来看,加入混元只有3个季度左右时间的姚顺雨,交作业的速度和质量是非常高效的。
这种进化的速度和节奏,来自于多方面。
Hy4 preview的新闻稿中,披露了一些模型“自进化”的案例。腾讯混元团队透露,Hy4 preview在自身研发的全链路过程中发挥了积极价值,首次参与训练方法、数据策略、评估体系和底层算子的自动优化。模型提出方案、运行实验并根据结果继续迭代,实验产生的代码、日志和反馈进入下一轮探索,形成初步的递归自我改进闭环。
而在模型和产品的协同当中,与WorkBuddy等产品的“Co-Design”(深度协同),是模型能力进化的关键,这其中还覆盖了与软件工程、游戏、金融、安全等顶尖腾讯专家的高质量数据共建。
模型的进化,强化Agent工具的“结果交付”能力。数据、产品协同,又为模型提供了养料,预留了充足的成长时间和空间,这是一个双向螺旋上升的过程。
更底层的基础设施建设上,腾讯也透露将继续加大投入,强化模型、产品与云基础设施的“增长飞轮”。财报显示,本季度腾讯研发投入同比增长35%,达到273亿元;资本开支528亿元,同比增长176%。
业绩会上,管理层也透露正在算力上进行大规模投入,“如果先用来自建模型、再用来开发应用、最后将算力对外出租的顺序推进,我们就能打造起一项极具规模的原生AI业务,这会带来非常可观的利润。”
模型“自进化”,产品、模型和数据协同,再加上基础设施等多方面的投入,成为Hy系列模型加速进化的关键要素,也正因为这一点,Hy4 preview的新闻稿当中还给了一个关键的暗示:按照这一节奏(两个月一次大版本),Hy4的下一版模型也将在近期陆续上线。
推荐阅读

汤道生姚顺雨对谈:腾讯AI的下半场

腾讯混元Hy3正式上线,坚持实用主义路线,Agent任务解决率跃升

