阶跃 StepAudio 3 发布:语音推理、实时对话双榜第一

阶跃 StepAudio 3 发布:语音推理、实时对话双榜第一
阶跃 StepAudio 3 发布:语音推理、实时对话双榜第一

阶跃星辰发布 StepAudio 3,同时推出 Realtime、ASR、TTS、Gen 和 Music 五款语音模型。

在 Artificial Analysis 的两项语音评测中,StepAudio 3 Realtime 均排名第一。其中,Conversational Dynamics 得分为 98.9%,高于 Qwen Audio 3.0 Realtime Plus 的 98.4% 和 GPT-Realtime-2 High 的 95.3%;Speech Reasoning 得分为 99.7%,同样位列第一。

Conversational Dynamics 主要评估模型对停顿、轮流发言、用户打断以及“嗯”“对”等附和语的处理能力;Speech Reasoning 则评估模型直接理解音频并完成推理的能力。

在 Artificial Analysis 非流式语音识别榜单中,StepAudio 3 ASR 的词错误率(WER)为 1.7%,与 Fun-Realtime-ASR-preview 并列第一。

此外,StepAudio 3 Gen 支持一次生成包含人声、音效、环境声和音乐的音频,并根据场景进行统一编排。

目前,五款模型均已进入阶跃星辰的语音产品线。

© 版权声明
THE END
喜欢就支持一下吧
点赞6 分享
评论 抢沙发

请登录后发表评论

    暂无评论内容