影音音频🔥7.0
阿里Qwen发布Qwen-Audio-3.1-Realtime:会思考、会行动、能自主决定何时开口的全双工语音模型
原标题: 阿里Qwen发布Qwen-Audio-3.1-Realtime:会思考、会行动、能自主决定何时开口的全双工语音模型
📋总体概括
阿里巴巴通义千问团队发布全双工语音模型Qwen-Audio-3.1-Realtime,具备推理、调用工具以及自主判断何时开口说话的能力。在τ-Voice适配测试中,任务成功率从78.4%提升至82.0%,对背景人声的误应答率从73%大幅降至13%。该模型已在QwenCloud上以API形式开放,标志着语音交互从简单对话转向能理解语境、控制发言时机的智能体方向。
⚡关键信息
- ▸阿里Qwen团队发布全双工语音模型Qwen-Audio-3.1-Realtime,可推理、调用工具并自主决定说话时机
- ▸在τ-Voice适配测试中,任务成功率从78.4%提升至82.0%
- ▸模型对背景人声的误应答率从73%骤降至13%,抗干扰能力显著增强
- ▸模型已在QwenCloud平台以API形式开放使用
🔥犀利点评
全双工语音模型的真正门槛不是听得清,而是知道什么时候闭嘴——背景人声误应答从73%砍到13%,这一刀才切中要害。能把推理和工具调用塞进语音链路,意味着语音助手终于要脱离复读机人设。不过API先行、不开权重,Qwen的商业化算盘打得比开源情怀响。
📰 相关资讯(与本文相关的其他资讯)
本文由本站自动聚合,以下为原始来源:前往 marktechpost.com 阅读全文 →