有道发布「子曰4」并全量开源多模态与TTS双引擎,大幅降低业务场景推理成本
“升级后的翻译模型使得整体推理速度大幅提升80%。”
图片
公司情报专家《财经涂鸦》获悉,近日,网易有道宣布“子曰”大模型迎来4.0版本的全方位升级,并正式迈入全模态时代。其中核心的“多模态模型”与“语音合成(TTS)模型”同步正式开源。
在27B 参数规模上,“子曰4”面向教育场景,将支持视觉输入的数理能力拉到了行业顶尖水平(SOTA);在同等参数规模的模型中,“子曰4”在处理带图表的数学题、物理题等高难度视觉数理问题上表现不俗;中文纯文本数理难题的性能也获得显著提升,模型准确率达81.4%,达到行业领先水平。
实际落地的“性价比”成为一大突破。据相关负责人介绍,新模型采用了精细化思维链重构方案,成功将推理思维链输出长度压缩了43.2%,可以用更少Token、更短的推理路径更快地给出答案,大幅降低了实际业务场景中的推理成本。
此外,子曰研发团队还针对国内学生真实的作业、考试和提问场景进行了深度优化。
开源TTS支持14 种语言,跨语种不再有「口音」
此次与多模态模型一同开源的还有语音合成(TTS)引擎 ,该引擎基于“语音编码器 + LLM”架构打造,面向开发者及内容创作者提供零样本、低门槛的语音克隆与情感合成能力。
目前,它已全面支持中文、英语、日语、韩语、德语、法语、西班牙语、印尼语、意大利语、泰语、葡萄牙语、俄语、马来语及越南语共14种语言。系统可支持不同语言间同一说话者音色的自然迁移,无需额外训练即可保持音色一致性,且合成结果具备母语级别的自然度与流畅度,跨语种克隆也没有口音泄露问题。
在声音克隆方面,子曰4实现了“上传即可克隆”的全量支持能力,用户仅需提供任意音频素材,系统即可在三秒内完成原声复制。据介绍,该引擎在克隆任务中的准确度超过97%,克隆音色与原声的相似度达85% 以上,在保留说话人独特音色的同时,还可精准还原其情感色彩,综合能力达到该领域第一梯队。
此外,该开源模型在真实多语言场景中展现出较好的稳健性,可应对日常对话、新闻播报、企业宣传等不同语境及复杂情感表达等多种合成需求。
翻译模型同步升级,推理速度提升80%
作为有道最为深厚的技术资产,翻译模型在本次升级中也迎来了重要的技术升级。
在数据层面,子曰团队收集并清洗了上亿级别的多语言数据,并聘请具有专八认证的专业人员进行多维度人工评估,从源头保证语料的高品质。
在算法层面,模型采用了创新的“多专家 OPD”模式,用一种更聪明的“软方式”博采众长,同时通过强化学习引入格式奖励和语言检测机制,有效解决了机翻常见的脱靶和语种混出问题。
为了应对高频、高并发的产业级应用,升级后的翻译模型配备了高效的加速机制,使得整体推理速度直接飙升80%。配合大模型自动评测与人工随机抽检相结合的定制化方案,新一代翻译模型在文本、图片和文档翻译等多场景下,都展现出了兼具速度与质量的极高水准。
从最初子曰以首个教育垂直大模型姿态亮相、推出颠覆传统口语练习模式的“虚拟人口语教练HiEcho”,到“子曰”2.0、3.0版本在软硬件生态中的全面扎根,有道始终走在 AI 赋能场景的最前沿。
2026年,有道按下应用落地加速键,陆续发布LobsterAI、有道宝库、有道同传Agent、Thinkflow等一系列AI Agent产品,实现了全场景 AI Agent 矩阵的前瞻性布局。
此次“子曰4”的升级与核心模型全量开源,不仅大幅降低了开发者在多模态与语音合成领域的应用门槛,也向行业展示了以底层核心技术滋养上层 Agent 矩阵的生态闭环。有道表示,随着全球开发者与开源社区的共同注入,希望这套全模态大模型生态能在更广泛的产业中激发出真正的生产力变革。
免责声明:上述内容仅代表发帖人个人观点,不构成本平台的任何投资建议。


