混元3正式版的产品证言有点意思:WorkBuddy排第一,微信众产品开测
开发者与腾讯广大投资者都很期待的混元大模型最新版本,Hy3今天正式发布,腾讯官方自评是:
展现出显著强于同尺寸模型的智能水平,并比肩更大尺寸旗舰模型的效果,大幅提升了在各类产品和生产力任务中的实用价值。
在一系列腾讯自身采信的评测标准中,Hy3相较Hy3 preview有了明显的提升,在国内基本做到“不弱于人”,但相较于全球公认性能最好的Claude、GPT等大模型的最高性能版本还是有一些差距。
图片
而混元团队表示其对比的大模型,其参数规模一般要比Hy3大出2-5倍,换言之Hy3在部署成本、用户体验的延迟方面会有一些相对优势。
模型与前端产品的Co-Design,已成为腾讯认为的AI下半场最核心命题之一。Hy3的优化重点,直接面向了产品侧,被总结为三点:
输出格式和工具调用稳定性:尤其重点提到对跨“脚手架”产品的泛化性,脚手架产品(如 Codebuddy、Cline、KiloCode)在 SWE Bench Verified 上的分数标准差控制在 4 个百分点以内;
知识常识和抗幻觉能力:在基于真实产品的内部评测中,Hy3 的幻觉率从 12.5% 降至 5.4%,常识错误率从 25.4% 降至 12.7%;
复杂上下文承接与多轮意图保持能力: Hy3 在 SFT 与 RL 阶段联合优化了指代消解、省略还原及多轮约束继承等业务痛点问题,内部评测的多轮问题率从 17.4% 降至 7.9% 。同时 Hy3 在长对话理解基准中取得显著跨越(如 MRCR 从 42.9% 升至 75.1%)。
图片
Co-Design另一侧的八款产品业务也纷纷出来证言。排第一的,就是当前腾讯最火的脚手架产品、享受最多推广资源,最近被曝出月活达到2000万的WorkBuddy,WorkBuddy产品负责人对Hy3的评价是:
内部测评数据显示:相比 Hy3 preview,任务解决率从 72% 跃升至 90%,平均耗时缩短 34%。Token 效率同样值得一提:高频办公任务中,Hy3 Token 消耗显著低于 GLM5.2——文档处理节省 47.4%,PPT 制作节省 49.0%。任务完成率上去了,单次消耗下来了,用户自然会把更多事情交给它。
排第二的是腾讯在Chatbot赛道的核心产品元宝,产品负责人的评价是:
接入 Hy3 后,用户使用元宝 Agent 感受到的是:Excel 不用反复调格式,数据分析结果直接可用,网页工具接入即跑。覆盖信息查询、数据处理、文档办公、生活决策、网页制作五大场景的内部评测,给出数字支撑:文档生成综合分提升 +7%,网页制作与自动化脚本提升+6%。
有趣的是,虽然腾讯当前最受关注的AI产品,微信小微最终确认采用了微信自研模型WeLM,但包括微信读书、微信公众号这些具体场景的产品,也都出来为Hy3证言。
微信公众号认为:Hy3 针对这类场景的识别能力明显升级,意图识别准确率从 98.28% 提升到 98.94%;更关键的是应对方式的变化:面对不完整的表达,Hy3 能结合账号定位与上下文做出合理判断,不脑补过度,也不机械套模板。
微信读书认为:Hy3 在网络文学标签标注场景中,相较 preview 在高质量人工标注数据集上准确率提高 14.1%,综合分类效能提升 8.4%。标签打得更准,意味着内容推荐的"第一步判断"更可靠。
无需讳言,如[企鹅生态]在此前《腾讯AI进入击球区》一文所述,考验腾讯模型-产品Co-Design战略理念的最核心大题,就是混元与微信的协同,这也是投资市场目前在隐隐关注的一件事情。
图片
但显然,为中国市场最活跃、最庞大的产品和服务生态接入高性能大模型,是一件远比想象中困难的事情,这需要时间与努力。如混元团队的最后总结:
从 1 月底重建基础设施,到 4 月发布 Hy3 preview,再到今天迭代升级 Hy3,我们用不到半年跑通了从底层基建到产品落地的完整研发链路。但这只是一个起点,还有很多问题需要解决,混元的重建和进步才刚刚开始。我们将持续踏实地扩大训练规模、提升数据质量、优化体验细节,保持敏捷迭代和坦诚开放的态度。
图片
免责声明:上述内容仅代表发帖人个人观点,不构成本平台的任何投资建议。


