小米开源工业级目标说话人语音识别大模型 CocktailASR-1
在喧闹中只听你说话!小米开源工业级大模型CocktailASR-1
xiaomi-cocktailasr-open-source
在人声鼎沸的聚会中,你能轻松聚焦朋友的声音,但传统的语音识别(ASR)系统却经常在这类场景下“抓瞎”。这就是语音界大名鼎鼎的“鸡尾酒会难题”。不过,这个困扰行业多年的痛点,现在终于有了破局者——小米最新开源了工业级目标说话人语音识别大模型 CocktailASR-1。
告别“全员转录”,精准锁定目标声音
传统的ASR模型习惯把收到的声音全盘转录,这在单人场景下没问题,但在多人交谈时就会彻底乱了套。CocktailASR-1 彻底改变了这种粗暴的输入逻辑,引入了基于参考声纹的目标识别机制。
简单来说,你只需给模型提供一小段目标人物的参考音频,它就能提取出对应的声纹特征。随后,在多人混合的音频流中,模型会像滤镜一样,只把目标人物说的话转录下来,而其他人的交谈声、背景噪音和混响,统统会被自动屏蔽。
在底层架构上,CocktailASR-1 采用了端到端的大语言模型架构,由 D2V2 音频编码器、Adapter 和大模型解码器串联而成,所有权重整合在单一检查点中。它的输入设计也相当巧妙:参考音频和目标音频直接拼接,中间用一秒静音作为隔断。这意味着无论是单人独白还是多人混战,无需切换模型就能一气呵成地处理。
降维打击:竞品错到离谱,它却稳如泰山
光说不练假把式,CocktailASR-1 在基准测试中的表现堪称“碾压级”。
在双人混合的测试场景中,它在 LibriMix2mix 和 LibriSpeechMix2mix 数据集上的字错率(WER)分别被压低到了惊人的 4.11% 和 2.90%。
到了更让人头疼的三人混合场景(LibriMix3mix),同赛道的一些知名竞品直接“翻车”,字错率竟然飙到了 76% 到 121% 之间——这基本等同于胡言乱语了。而 CocktailASR-1 依然将字错率死死控制在 12.29%。
不仅在模拟数据上表现强悍,面对 AMI SDM 和 AliMeeting Far 这类更具挑战性的真实会议录音,它也大幅甩开了现有的各类解决方案。甚至在常规的单人场景下(如 LibriSpeech、WenetSpeech、CommonVoice-zh),它的表现也实现了全面超越。
不止于准:工程落地更显实用主义
除了极高的识别精度,CocktailASR-1 还自带了两个极具落地价值的亮点功能:
- 防误触的负样本拒识能力:如果参考音频里的人根本没参与当前对话,模型会直接输出空文本。这个功能对智能音箱、车机语音助手来说简直是救星,完美避免了设备被旁边不相干的人“隔空唤醒”或“误触发”的尴尬,且在多个数据集上表现优异。
- 思维链推理过程:在给出最终文本前,模型能通过特定标签展示它是如何判断目标说话人的推理过程。虽然这不会显著提升识别精度,但大大增强了系统的可解释性,给开发者调试提供了极大的便利。
开箱即用:极简部署体验
对开发者极度友好的是,CocktailASR-1 的代码已在 GitHub 上以 Apache 2.0 协议正式开源。它的运行环境非常轻量,不需要一堆乱七八糟的依赖,只要有 torch、torchaudio、transformers 和 soundfile 等基础库,就能轻松从 HuggingFace 拉取并部署使用。
小米这次的底层技术开源,不仅仅是放出了一个高性能模型,更是在逻辑上指明了ASR技术的新风向:语音识别正在从传统的“记录所有声音”,正式进化到“在喧嚣中只听懂你”。