Meta发布Muse Voice Transcribe:中英文夹杂也能准确转写,一场1小时多人对话轻松拿下

AI资讯3分钟前发布 EdgeClaw
1 00

Meta发布Muse Voice Transcribe:中英文夹杂也能准确转写,一场1小时多人对话轻松拿下

开会时有人中英文夹杂、七嘴八舌抢话,会后整理录音是不是很头疼?9月2日,Meta推出由超级智能实验室开发的首个实时音频感知模型Muse Voice Transcribe,专治这类”混乱”场景。

这个语音转写模型,强在什么地方

Muse Voice Transcribe提供实时流式自动语音识别(ASR),支持超过20位说话人的语音分割,还能处理超过1小时的长音频。最让人眼前一亮的是它的”无缝语码切换”能力——无论是讲中文、中式英语口音,还是中英文混合表达,它都能边听边转,速度和准确率表现相当不错。

在Artificial Analysis的流式语音转文本和公开语音分割基准测试中,Muse Voice Transcribe目前排名第一。它已使用70多种语言训练,其中25种语言经过全面验证,初始版本建议用户优先试用这25种语言。

技术拆解:它是如何做到又快又准的

作为Muse Spark系列中的自回归多模态模型,Muse Voice Transcribe以80毫秒为单位处理音频,每个片段被转换为一个软token。模型会自己决定是继续监听下一段音频,还是输出一个文本token,从而完全控制”听多久再开口”,这就是它延迟可控的底层逻辑。

玻璃质感语音波形与多人对话气泡界面,展示Meta语音转写模型的多人会议场景

准确率和延迟往往此消彼长,但Muse采用”自适应延迟”机制,通过强化学习根据每个单词的难度动态调整等待时间,在速度与准确率之间找到平衡点,实现帕累托最优。

说话人分割和端点检测也建立在流式ASR之上:模型用一个特殊token标记说话人切换,用另一个token标记语音开始与结束,让”谁在说、说到哪了”一目了然,全程无需后处理。

接入方式与价格:普通人也能用上

目前Muse Voice Transcribe可以通过Meta Model API、Mac版Meta AI和Muse Code使用。定价也相当亲民:每1000分钟3美元(约合人民币20元),每小时只要0.18美元(约合人民币1.21元)。按住Fn键,就能在任意窗口调用语音听写功能。

戴耳机人物面对音频波形与中英文转写字幕屏幕,暖橙藏蓝对比,语音转写工具应用插画

语音识别的下一站:从”工具”到”耳朵”

在真实场景里,交流远比标准测试复杂:多语言交杂、有人插话、声音重叠,一聊就是几十分钟甚至几个小时。Muse Voice Transcribe瞄准的正是这些痛点。语音转写正在从一个独立的”语音转文字”工具,变成AI系统的实时感知层。

下一阶段,语音识别的竞争会同时落在低延迟、长上下文、多说话人、多语言与语境理解上,并最终与大模型的推理、记忆和工具调用融合。届时”听见”只是入口,系统还要知道谁在说、什么时候说完、这句话和前面有什么关系。Meta这一枪,打得很响。

© 版权声明

相关文章