资讯🔥8.0

小米开源工业级目标说话人语音识别大模型 Xiaomi-CocktailASR-1

IT之家·2026/9/11 06:51:39🔗 原文

📋总体概括

小米于9月11日发布并开源工业级目标说话人语音识别大模型 Xiaomi-CocktailASR-1,主打解决多人同时说话时识别率骤降的「鸡尾酒会」难题。模型采用端到端 LLM 架构,以目标说话人参考音频作声纹提示,在多人嘈杂环境中只转录目标用户语音,并称在多个主流多说话人测试集上达到 SOTA。同时其单人识别性能比肩标准 ASR 模型,可拒识非目标说话人、目标不在场时输出空文本以防误触发,还支持思维链推理提供可解释过程,代码已在 GitHub 开源。

关键信息

  • 小米9月11日发布并开源工业级目标说话人语音识别大模型 Xiaomi-CocktailASR-1
  • 模型瞄准「鸡尾酒会」难题:两人及以上同时说话时语音识别率会大幅下降
  • 采用端到端 LLM 架构,用目标说话人参考音频作声纹提示,仅转录目标用户语音
  • 官方称在多个主流多说话人测试集上达到 SOTA,单人识别性能比肩标准 ASR 模型
  • 具备拒识能力,目标不在场时输出空文本避免误触发,并支持思维链推理模式

🔥犀利点评

鸡尾酒会问题确实是语音识别绕不开的硬骨头,小米拿 LLM 架构加声纹提示做目标说话人提取,方向是对的,开源姿态也值得肯定。但「SOTA」出自官方之口,测试集是哪几个、领先幅度多少一概没说,这波宣传含金量得打折看。真正的考验在工业场景:嘈杂工厂、车载环境里拒识误判率如何,社区生态会不会有人跟进,这些才决定这模型是练手作还是真家伙。

本文由本站自动聚合,以下为原始来源:前往 IT之家 阅读全文