腾讯混元Hy4来了 ! 7700亿参数直接开源
(来源:AI 前沿早知道)
腾讯把混元Hy4 preview放上了开源平台。
总参数770B,激活参数49B,上下文长度干到100万token。四个平台同时上线,HuggingFace、GitHub、ModelScope、Gitcode都能直接拉权重。
这不是实验室里的样品,是跟着腾讯内部软件工程、游戏、金融、安全这些业务一起打磨出来的版本。
百万上下文+770B,到底是什么概念

很多人对数字没体感,说直白点。
100万token差不多能装下70多万汉字。一整本《红楼梦》全文丢进去,它能精准定位到任意一回的细节,不用你分段摘要、来回补充背景。
做开发的感受会更深。一个中型项目的全量代码库一次性喂进去,跨文件排查bug、梳理整体架构,不用拆成碎片反复投喂。
770B总参数用的是MoE稀疏架构,实际推理只激活49B参数。相当于把大模型的能力堆上去,又没让推理成本跟着翻几倍。
跟上一代Hy3比,总参数从295B涨到770B,激活参数从21B涨到49B,上下文从256K直接翻到1M。四个月时间,跨代升级。
真实场景能力,才是这次的硬货

软件工程这块,它能跟上长周期的开发流程。从需求规划、代码编写到验证用例,全流程都能参与,不是只会写单段函数的代码片段工具。前端界面的审美和交互也做了优化,生成的页面不丑。
办公场景更直观。从原始数据处理、表格生成到写演示文档,它能一条龙走下来,不用你中间倒格式、转内容。跨文件协同、多维数据分析这些以前要人工拼接的活,现在一个指令就能出结果。
游戏行业的用法最让人意外。说一句玩法需求,直接生成可玩原型。它能熟练操作主流游戏引擎,生成的东西不是demo级别的摆设,是真能跑起来的。策划想验证个点子,不用等程序美术排期,几分钟就能看到实际效果。而且它还能自己纠错——生成过程中发现bug会自动修复,不用你盯着改。
科研领域也有实打实的进展。配合数学推理工具Hyra,它啃动了百年几何难题——三维Blaschke-Lebesgue问题,把体积下界从之前的0.380799推进到0.41104,离Meissner四面体猜想的0.41986只剩不到2%的差距。
分子动力学模拟上,32512原子的磷脂双分子层SO3LR,在高度优化的JAX实现上又提速了2倍,达到54.9毫秒/步,单张高端GPU能容纳30万原子。新材料筛选、药物分子研究这些方向,计算空间又大了一截。
最大的技术亮点:AI自己优化自己
这次发布最值得关注的,不是参数数字,是递归自我优化。
Hy4 preview第一次全程参与了自身的研发。训练方法怎么调、数据策略怎么选、评估体系怎么建、底层算子怎么优化,这些以前靠研究员拍板的事,模型自己提方案、跑实验、看结果再迭代。
实验产生的代码、日志、反馈数据,直接回流到下一轮探索。官方管这个叫"初步的递归自我改进闭环"。
翻译一下就是:AI不光在学怎么回答问题,还在学怎么把自己造得更好。
它还自己分析了推理系统的瓶颈,围绕算子融合和通信优化做了多轮改进,端到端吞吐比基线提升了31.8%。不同上下文长度、不同并发度下都稳定有效。
AI优化AI的算力效率,这个闭环如果能持续跑下去,长期价值可能超过任何单次参数提升。
盲测得分压过GLM和Kimi

腾讯没只拿基准榜单说话,搞了次更贴近真实工作的盲测。
163名内部专家,203个真实工程任务,双盲打分。
最终Hy4 preview平均分2.99(满分4分),GLM-5.3是2.92,Kimi K3是2.94。
具体到胜率,对GLM-5.3胜46.8%、平12.8%、负40.4%;对Kimi K3胜率51.2%。
分数差距不算大,但都是真实业务场景打出来的分,比刷公开榜单的参考性要强。
它还登上了Code Arena WebDev榜单第5名,在开源模型里排第3。
定价很良心,还能限免体验

API定价:输入6元/百万token,输出18元/百万token,缓存命中只要0.3元/百万token。
对比一下,Kimi K3输出100元/百万token,GLM-5.3输出28元,DeepSeek V4 Pro高峰时段输出27元。Hy4这个定价,在旗舰模型里属于第一梯队的便宜。
模型已经接入WorkBuddy、CodeBuddy国内国际版、元宝、ima这些腾讯产品,普通用户直接就能用。API方面腾讯云TokenHub和OpenRouter都能接。
WorkBuddy和CodeBuddy还开了为期两周的限时免费,想尝鲜的现在就能去试。
别着急吹,它还有明显短板
官方自己也没藏着掖着,明确说这只是Hy4的早期迭代版本,不是最终成品。
预训练和后训练都还有提升空间。遇到复杂长任务时,容易出现思考时间过长、过度自我验证的问题。
基准测试上也不是全面领先。Terminal-Bench 2.1得分85.4,低于GLM-5.3、Kimi K3、Qwen3.8 Max和GPT-5.6 Sol。衡量职业知识工作的GDPval-AA V2得分1678,也低于几款主流模型。
简单说就是,简单任务用着很爽,复杂的长链路任务还差点意思。想直接拿来当生产主力的,可以再等等后续迭代,现在版本更适合尝鲜测试。
8月的大模型战场,已经变天了
整个8月,国内大模型圈跟约好了一样密集发布。
DeepSeek V4 Pro正式版上线,百万上下文+智能体能力;阿里通义千问Qwen3.8系列,高性价比+全模态;智谱GLM-5.3,重点砸编程和网络安全。临近月末,智谱和千问还深夜推出Flash模型,划新的"斩杀线"。
腾讯这波Hy4 preview,是8月迭代潮的收官之作。
能看出来一个明显趋势:大模型竞争早就从比参数数量,卷到了比上下文长度、比真实场景能力、比工程落地效率。
以前发布会比谁参数大,现在比谁能真正干活。代码写得好不好、文档处理快不快、游戏原型能不能跑、科研问题能不能解,这些才是硬指标。
大厂开源也越来越务实。早些年很多开源模型更像实验室样品,落地要做大量适配。这次腾讯直接把内部业务打磨过的版本放出来,开发者拿过去就能用。
自今年2月重建基础设施以来,混元平均每两个月迭代一次大版本,preview先行收集反馈,正式版跟进优化。按这个节奏,Hy4的下一版很快就会来。
玩家越多,卷得越实,普通开发者和用户就能拿到更好用的工具。
你怎么看腾讯这次770B开源?评论区聊聊,抽3位读者送AI agant 教程
