Meta 发布实时语音转写模型 Muse Voice Transcribe

Meta 发布实时语音转写模型 Muse Voice Transcribe
Meta 发布实时语音转写模型 Muse Voice Transcribe

Meta Superintelligence Labs 发布 Muse Voice Transcribe,将实时语音转文字、说话人区分,以及判断用户何时说完等能力整合进一个模型。该模型最长可处理超过 1 小时的音频,并支持区分 20 多名说话人。

在 Artificial Analysis 的英文实时转写测试中,Muse Voice Transcribe 的 WER(词错误率,越低越好)为 3.1%,低于 GPT Live Transcribe 的 3.9% 和 Gemini 3.5 Transcribe Live 的 4.0%。在说话结束后,该模型约 0.16 秒即可给出最终文本。

该模型不会为所有词设置固定等待时间,而是每次读取 80 毫秒音频后,自行判断是继续接收语音还是开始输出文本。简单词可更快生成,复杂词则会等待更多上下文再确认。Meta 表示,其通过强化学习同时优化准确率和延迟。

Muse Voice Transcribe 使用 70 多种语言训练,其中 25 种语言已完成重点验证,并可识别一句话中中英文混合表达。目前,该模型已接入 Meta AI for Mac 和 Muse Code,并开放 Meta Model API。价格为每 1000 分钟 3 美元,约合每小时 0.18 美元。

© 版权声明
THE END
喜欢就支持一下吧
点赞12 分享
评论 抢沙发

请登录后发表评论

    暂无评论内容