
语音转写正变成AI系统的实时感知层。
编译 | ZeR0
编辑 | 漠影
智东西9月2日报道,今日,Meta推出由Meta超级智能实验室开发的首个实时音频感知模型Muse Voice Transcribe。
该模型提供实时流式自动语音识别(ASR)、支持超过20位说话人的语音分割以及端点控制功能,支持多语言,能处理超过1小时的长音频,可实现无缝语码切换,并通过语言、关键词和上下文偏好来提高识别准确率。
从示例来看,无论是讲中文、中式英语口音,还是中英文混合表达,这款模型的转写速度和效果都相当不错。
精彩评论