据报Meta Platforms(META)发布首款实时音频感知模型 支持多人多语言流式转写

金吾财讯09-02

金吾财讯 | 据外媒报道,Meta Platforms(META)正式发布Muse Voice Transcribe,这是公司首款实时音频感知模型,开发者可通过Meta Model API调用该服务。

定价方面,服务费用为每1000分钟音频3美元,折合每小时0.18美元。该模型将流式语音识别、说话人分离、端点检测整合在一套流程内,可边说话边输出转写文本,无需等待音频完整录制完成。业务能力上,该模型能够区分同一段录音里20名以上不同发言者,自动识别语句停顿边界;训练覆盖70余种语言,发布时完成25种语言验证,支持时长超1小时音频,也适配句内、句间的多语言切换。开发者还可以通过语言、关键词、上下文偏置,提升特定术语、业务场景下识别精度。技术层面,Meta采用自适应延迟机制,动态权衡识别时延与准确率,针对每一个词汇判断需要接收多少音频再输出结果,兼顾实时响应效果与识别质量。

免责声明:本文观点仅代表作者个人观点,不构成本平台的投资建议,本平台不对文章信息准确性、完整性和及时性做出任何保证,亦不对因使用或信赖文章信息引发的任何损失承担责任。

精彩评论

我们需要你的真知灼见来填补这片空白
发表看法