影音音频🔥7.0

阿里Qwen发布Qwen-Audio-3.1-Realtime:会思考、会行动、能自主决定何时开口的全双工语音模型

原标题: 阿里Qwen发布Qwen-Audio-3.1-Realtime:会思考、会行动、能自主决定何时开口的全双工语音模型

marktechpost.com·2026/9/29 04:58:15🔗 原文

📋总体概括

阿里巴巴通义千问团队发布全双工语音模型Qwen-Audio-3.1-Realtime,具备推理、调用工具以及自主判断何时开口说话的能力。在τ-Voice适配测试中,任务成功率从78.4%提升至82.0%,对背景人声的误应答率从73%大幅降至13%。该模型已在QwenCloud上以API形式开放,标志着语音交互从简单对话转向能理解语境、控制发言时机的智能体方向。

⚡关键信息

  • ▸阿里Qwen团队发布全双工语音模型Qwen-Audio-3.1-Realtime,可推理、调用工具并自主决定说话时机
  • ▸在τ-Voice适配测试中,任务成功率从78.4%提升至82.0%
  • ▸模型对背景人声的误应答率从73%骤降至13%,抗干扰能力显著增强
  • ▸模型已在QwenCloud平台以API形式开放使用

🔥犀利点评

全双工语音模型的真正门槛不是听得清,而是知道什么时候闭嘴——背景人声误应答从73%砍到13%,这一刀才切中要害。能把推理和工具调用塞进语音链路,意味着语音助手终于要脱离复读机人设。不过API先行、不开权重,Qwen的商业化算盘打得比开源情怀响。

本文由本站自动聚合,以下为原始来源:前往 marktechpost.com 阅读全文 →