2026-09-02 · AI 资讯
Meta 发布 Muse 实时音频转写模型:支持 20 人同场分轨识别

Meta 近日推出首个实时音频感知模型 Muse Voice Transcribe,不仅支持流式语音识别,还能精准处理多人复杂场景。该模型能够同时识别并分离 20 余名说话者的语音,自动进行分轨转写。其定价策略也极具竞争力,仅为每 1000 分钟 3 美元,显著降低了会议记录、实时字幕等应用的开发成本。

技术上,Muse Voice Transcribe 引入了“自适应延迟”机制,系统会针对语音难度动态调节处理逻辑:对于发音清晰、语境简单的词语,系统会实现秒级输出;对于专业术语或复杂语境,则会调用更多前后文信息以确保准确度。这种平衡速度与准确性的方案,使其在目前流式语音识别排行榜中位居首位。
该模型训练覆盖了 70 余种语言,并支持超过 1 小时的长音频处理,满足了多语言跨国会议及大型讲座的需求。开发者可通过 Meta Model API 调用此项能力,其对自然语言切换的支持,使得该产品在处理复杂办公场景时表现尤为出色。
