Muse Voice流式最终转录第一
Meta发布了Muse Voice Transcribe,在AA-WER Streaming的Final Transcript准确率榜单上位居第一,在语音结束后0.16秒达到3.1%的WER。
Muse Voice Transcribe是Meta Superintelligence Labs开发的首个流式语音转文本模型。Meta表示该模型训练数据覆盖超过70种语言,其中25种经过充分验证,并支持超过一小时的音频输入而无需后处理。它以80毫秒为单位处理音频,可通过Meta Model API、Meta AI for Mac和Muse Code使用。
要点
➤ Final Transcript:Muse Voice Transcribe在语音结束后0.16秒达到3.1%的WER。相比Cartesia Ink-2(semantic endpoints)的3.4%和0.43秒,Muse更准确也更快;相比Cartesia Ink-2(external endpoints)的4.0%和0.07秒,Muse更准确但更慢。相比ElevenLabs Scribe v2 Realtime的3.6%和0.14秒,Muse也更准确,但速度略慢。
➤ First Partial Transcript:该模型在0.13秒时达到3.6%的WER,在准确率和延迟上都略优于ElevenLabs Scribe v2 Realtime。相比Cartesia Ink-2(semantic endpoints)的4.9%和0.17秒,Muse更准确也更快;相比Cartesia Ink-2(external endpoints)的4.0%和0.07秒,Muse更准确但更慢。
➤ 价格:Muse Voice Transcribe每小时收费0.18美元,即每1000分钟3美元。低于Cartesia Ink-2的4美元,也不到ElevenLabs Scribe v2 Realtime和Deepgram Flux(均为6.50美元)的一半。
继续滑动查看完整内容。
Meta MuseVoiceTranscribe 语音转文本


