资讯🔥8.0

OpenAI 扩大实时语音模型能力:GPT-Live-1 上线 API,支持打断处理、工具调用和电话语音智能体

IT之家·2026/9/11 00:28:22🔗 原文

📋总体概括

OpenAI 将实时语音模型 GPT-Live-1 开放 API,支持全双工对话、打断处理、背景噪声适应及电话语音智能体场景。模型把语音理解与输出合并于单一模型,省去传统语音转文字加文字转语音的多级链路以降低延迟,并可将复杂推理和工具调用交给后端文本模型,支持与 Codex、企业系统对接及人工转交。早期客户数据亮眼:Speak 平台误打断减少近 80%,某医疗平台删减约 2.3 万行代码。在 Full Duplex Bench 上比 GPT-Realtime-2.1 高出 30 个百分点。

关键信息

  • GPT-Live-1 上线 API,支持全双工语音、打断处理、停顿与背景噪声适应
  • 语音理解与输出整合于单一模型,减少多级衔接以降低延迟,可调用后端文本模型做推理和工具调用
  • 面向电话场景如餐厅预订、客服,支持查询企业系统、执行获批操作并转交人工
  • Speak 平台误打断次数减少近 80%;某医疗平台减少 80% 代码量、删除约 2.3 万行
  • Full Duplex Bench 评测中较 GPT-Realtime-2.1 高出 30 个百分点

🔥犀利点评

这基本宣告了传统语音管线的死刑。把 ASR、LLM、TTS 三段式拼装的活儿一口吃进单模型,省的不只是延迟,更是开发者维护胶水代码的心智成本,2.3 万行被删的代码就是最好的墓志铭。真正的战场在电话客服这类劳动密集场景,OpenAI 拿打断处理和误打断数据说事,分明是冲着呼叫中心预算去的。唯一要打问号的是评测自家模型自当裁判,30 个百分点的领先还得看第三方验证。

本文由本站自动聚合,以下为原始来源:前往 IT之家 阅读全文