资讯

谷歌发布 Gemini 3.5 Transcribe 语音转文本模型,能自动删除口头禅

IT之家·2026/8/27 04:38:39🔗 原文

📌 概要

<p>IT之家 8 月 27 日消息,在外界仍等待 Gemini 3.5 Pro 发布之际,谷歌先推出了 3.5 系列中的另一款模型。该公司今日发布了 Gemini 3.5 Transcribe 语音转文本模型,这是一款旨在优化语音输入体验的 AI 模型,能够自动删除语音中的“嗯”“呃”等口头禅以及说错后自行纠正的内容,最终生成更加通顺、整洁的文本。</p><p style="text-align

<p>IT之家 8 月 27 日消息,在外界仍等待 Gemini 3.5 Pro 发布之际,谷歌先推出了 3.5 系列中的另一款模型。该公司今日发布了 Gemini 3.5 Transcribe 语音转文本模型,这是一款旨在优化语音输入体验的 AI 模型,能够自动删除语音中的“嗯”“呃”等口头禅以及说错后自行纠正的内容,最终生成更加通顺、整洁的文本。</p><p style="text-align: center;"><img class="no-alt-img" src="https://img.ithome.com/newsuploadfiles/2026/8/8fff6d8c-cdbc-4eb9-a998-82a41b60a8c7.jpg?x-bce-process=image/format,f_auto" /></p><p>IT之家注意到,这款模型目前已经为 Pixel 11 上 Gboard 键盘的“Rambler”功能提供支持,接下来还将陆续进入谷歌旗下更多产品和服务。</p><p>谷歌表示,与此前名为 Chirp 3 的语音转文字引擎相比,Gemini 3.5 Transcribe 在速度和准确性方面都有提升。从用户说话到最终生成转录文本,整体速度预计可提升约 70%;在实时语音场景下,其错误率已经降至 5.5%。</p><p style="text-align: center;"><img class="no-alt-img" src="https://img.ithome.com/newsuploadfiles/2026/8/c4932050-1950-4784-acd4-3a42deced014.png?x-bce-process=image/format,f_auto" /></p><p>不过,准确率的提升幅度并不算特别大。按照谷歌的数据,Chirp 3 的错误率为 7.32%。但对于经常使用语音输入的用户来说,即便只是少打几个错字,也意味着后续需要手动修改的内容更少,因此依然是一项实用的改进。</p><p>Gemini 3.5 Transcribe 的能力也不只是“听清楚”用户说了什么,它还试图理解用户真正想表达的意思。在说话过程中,模型可以自动删除“嗯”“呃”等影响语句流畅度的口头禅。如果用户说错话后立即进行修正,它也能够实时调整已经生成的文本。此外,用户还可以提供自定义词汇表,让模型更好地识别专业术语和特定领域的词汇。</p><p>该模型目前支持 85 种语言,并且可以处理最多包含 3 名说话者的预录音频。</p><p>当然,这种功能也存在一个明显的问题:用户需要相信 AI 能够准确理解自己真正想表达的内容。至少在较短的文本中,从 Rambler 功能的实际体验来看,模型确实能够较好地清理前后不一致的表达和说话时的磕绊,让文本看起来更加自然。</p><p>但与此同时,Gemini 3.5 Transcribe 并不只是简单地把语音转换成文字。AI 在整理内容的过程中,实际上可能会改变用户原本的措辞。因此,在一些需要严格保留原话、不能随意修改表述的场景中,这种“智能润色”未必适合使用。</p>