
Hy4 preview才刚发布3天,腾讯WorkBuddy就针对Hy4 preview推理集群进行了紧急扩容,官方宣称,将持续动态调配资源。
然而WorkBuddy表示,受限于高端算力总量与高峰并发集中,仍不排除个别时段会继续出现排队情况。因此官方推荐用户在Hy4 preview排队期间切换至Hy3,并且同时还把WorkBuddy的Hy3限免延长至2026年9月30日23:59。
Hy4 preview总参数770B,激活参数49B,上下文1M,Terminal Bench 2.1得分冲到85.4,开源第一、全球第三,SWE-bench Multilingual得分82.9,同样是开源第一。
8月28日发布当天,API排队用户就超过了5000人。
为什么Hy4 preview这么受欢迎?
一方面是WorkBuddy本身的用户量增长,6月时就有数据显示,WorkBuddy的MAU突破了2000万。
但更重要的是,这是腾讯基础模型部成立之后的第一个新模型,也是一款从头到尾贯彻姚顺雨理念的产品。
在Hy4 preview的技术报告中,腾讯大大方方地标明Hy4 preview使用了哪家的技术,并说明了对其进行修改的具体方式。
有意思的地方是,即使用了别人的技术,Hy4 preview却形成了独特的风格。
01
三种“自进化”
一切要从自进化开始说起。
Hy4 preview的README里,这样写道,灵感来自于DeepSeek和GLM(inspired by DeepSeek and GLM)。
Hy4 Preview注意力模块用的是DeepSeek的Gated以及MTP层做投机解码;配的是智谱的IndexCache做跨层稀疏索引复用;残差通路用了字节的iHC(identity Hyper-Connections)。
但如果只看到这些,就错过了Hy4真正反常的地方。
混元团队在论文中表示,Hy4 preview第一次全程参与了制造自己的过程,在训练方法、数据策略、评估体系和底层算子这四个环节,全部引入了模型的自进化机制。
但有意思的是,明明说灵感来自于智谱和DeepSeek,可在自进化的方向上,Hy4 preview又和DeepSeek、GLM完全不同。
智谱的自进化,发生在训练阶段,目标是让模型本身变聪明。
智谱给GLM-5.3搭了一条“自己出真题自己做”的流水线,让一个“AI研究员”去真实工程师的工作场景里观察,把实际业务提炼成训练数据。再让一个“AI判卷员”先闭卷做一遍,只有确认真的有解,才会把题目放进题库。
配合SAO和slime框架,GLM-5.3在不更换基座的前提下,比GLM-5.2的长程编码训练速度提升了约 2.3 倍。
这套逻辑的本质是生物学意义上的进化,基因在迭代中变得更适应环境。
DeepSeek的自进化,发生在运行阶段,目标是通过DSH让模型的“身体”可以无限重组。
DSH的核心设计原则是“一切皆插件”,Agent发现缺什么,就现场补什么,用完再无痕拆下来。官方管这叫self-modification。
这是工具学意义上的进化,人没变,只是学会使用各种工具,让自己能干更多的事情。
腾讯Hy4 preview的自进化,既不在训练阶段,也不在运行阶段,它发生在研发流程本身。
Hy4既不是智谱那样“让自己变聪明”,也不是DeepSeek那样“让自己的工具变多”,它是在定义自己,“我作为Hy4 Preview,我应该是什么样?”比如“我”的训练方法应该怎么设计、数据策略应该怎么定、评估体系应该怎么建。
先定义好自己是什么,再朝着自己想要的方向去发展。
要想全链路自进化,第一件事就是要统一组织。
Hy4 preview自进化的4个环节,其实就是大模型研发的完整链条。从最基本的训练、数据、评估,到最后怎么把训好的模型高效地跑起来。
这也就是说,姚顺雨能完整地统筹整个大模型的研发了。

过去这些事物是分开的,腾讯将其分成了两个平行部门,分别为大语言模型部和多模态模型部。各自拥有独立的训练数据、技术框架、研发流程和评测标准。
而且当时的腾讯还有AI Infra、AI Data和数据计算平台部分别掌管不同的数据。
7月合并成基础模型部,姚顺雨一个人统管之后,这条链路才第一次被打通。Hy4 preview能参与全链路,本身就代表着组织现在是一条心了。
姚顺雨对工程化非常重视。
三家里面,只有腾讯混元把“底层算子优化”和“推理吞吐量提升”这些关乎模型实际运行的东西纳入自进化的列表里。
姚顺雨入职后第一件事就是重建基础设施,他在6月与汤道生对谈中提到,“我们把Infrastructure重建了,无论是预训练还是强化学习”。
哪怕是OpenAI和Anthropic,算力都是最稀缺的资源,汤道生曾公开承认“算力严重不足拖慢了模型训练与产品发展”。姚顺雨必须把每一分算力都榨干。
一切的核心在于姚顺雨的方法论——Co-design。边训边用,让产品反馈倒逼模型迭代。
Hy3时期,Co-design主要发生在模型和产品之间,比如将CodeBuddy、WorkBuddy的用户反馈,回流到模型训练当中。
到了Hy4 preview这里,Co-design的范围扩大了,整个模型研发流程都遵从这套方法论。
也就是说,姚顺雨统一了混元模型,并且让模型与腾讯的所有条线接轨,将他对AI的理解,完全倾注其中。
02
模型是姚顺雨方法论的物质化证明
之所以要将姚顺雨的理念贯彻进模型当中,是因为他本身就是语言Agent研究的开创者之一。
ReAct是姚顺雨的代表作,论文于2022年10月挂出,发表在ICLR 2023上,被评为notable top 5%,引用量超过10000次。
而ReAct也是如今所有Agent的工作原理。 它的核心是把“推理”和“行动”从两个分离的步骤放在同一个prompt模板里的交替循环。想一步、做一步、看结果、再想。
不管是Claude Code还是Codex,底层“思考 - 调用工具 - 观察结果 - 继续思考”循环,本质上都是ReAct的变体。
姚顺雨的第二大代表作便是Tree of Thoughts(ToT),这是一种增强推理的策略。
在关键决策点展开多条思路,分别评估,再选最优路径继续。
这个方法在研究层面影响很大,但在实际产品中直接用ToT的其实并不多,因为树搜索的token成本太高,产品里更多是简化版的“多路径尝试”或者“遇到岔路时多想一下”。
ToT扩展了模型的“深度思考”能力,尤其是当ReAct循环中遇到关键的决策点时,ToT提供了一种“要不你再寻思寻思呢?”的机制。
从Hy3到Hy4 preview,最直观的感受就是,姚顺雨把他的论文完全搬进了模型中。
Hy3的定位是“强Agent型”模型,ReAct循环已经有了基础,能执行多步骤任务。但Hy3没有“过度验证” 的行为特征,说明它的推理更多是单路径的,想到一条路就走,走到黑算完,缺乏多路径探索和评估的机制。
只有模型真的在展开多个候选、逐个评估、确认无误才落笔,才会表现出一种“我必须得狠狠验证对不对”。
Hy4 preview在推理深度上明显加强了,比如模型能反复自我验证、推理过程偏长,这些都是ToT思想在工程中的系统体现。
从Hy3到Hy4 preview,不是简单的参数变大,是整个产品的逻辑都变了,从“单路径执行”升级到了现在的“多路径探索+深度验证”。

甚至混元官方主动在论文中承认,Hy4 preview复杂任务上可能思考时间过长,并且有过度自我验证的倾向。
姚顺雨算是彻底吃上“老本”了,以前在实验室里捣鼓的玩意,现在可算是逮着机会工程化了。
但光有方法不行,还得有训练数据支持。
大部分大模型的训练数据是“结果导向”的,给出题目,再给出答案,可中间过程被省略了,模型只能学到“看到这个问题给出这个答案、看到那个问题给出那个答案”。
这种数据训练出来的模型,做简单题没问题,然而一旦遇到需要多步骤、需要试错、需要根据中间结果调整策略的复杂任务,就容易崩,因为它从来没学过“边做边看边调整”这件事。
可ReAct和ToT又强调的是模型边看边解答的这个循环,那该怎么办呢?
Hy4 preview在论文中写到,通过腾讯内部的软件工程师、游戏开发者、金融分析师、安全专家,围绕他们真正交付的工作共建数据,再和CodeBuddy、WorkBuddy这些真实产品共同设计。
模型进步的每一格,都锚在真实生产力上。模型本身,就是姚顺雨方法论的物质化证明。
Hy4 preview要远比Hy3更加得“姚顺雨”。Hy3现在看来更像是姚顺雨能力的印证,到了Hy4 preview这里,姚顺雨“转正”了。
精彩评论