金吾财讯 | 据外媒报道,Meta Platforms(META)正式发布Muse Voice Transcribe,这是公司首款实时音频感知模型,开发者可通过Meta Model API调用该服务。
定价方面,服务费用为每1000分钟音频3美元,折合每小时0.18美元。该模型将流式语音识别、说话人分离、端点检测整合在一套流程内,可边说话边输出转写文本,无需等待音频完整录制完成。业务能力上,该模型能够区分同一段录音里20名以上不同发言者,自动识别语句停顿边界;训练覆盖70余种语言,发布时完成25种语言验证,支持时长超1小时音频,也适配句内、句间的多语言切换。开发者还可以通过语言、关键词、上下文偏置,提升特定术语、业务场景下识别精度。技术层面,Meta采用自适应延迟机制,动态权衡识别时延与准确率,针对每一个词汇判断需要接收多少音频再输出结果,兼顾实时响应效果与识别质量。
精彩评论