Google DeepMind 于 2026 年 8 月 26 日发布 Gemini 3.5 Transcribe,定位为面向实时流和预录音频的语音转文字模型。下面先保留完整英文线程,并逐段给出中文翻译。

原帖英文与翻译

Gemini 3.5 Transcribe is our latest speech-to-text model for precise and intelligent transcriptions. 🧵

中文翻译:Gemini 3.5 Transcribe 是我们最新的语音转文字模型,面向精确、智能的转写。🧵

Here’s what’s new: 🔵 It’s better at understanding complex phone numbers, postal codes, and order IDs – even in noisy environments. 🔵 It can remove filler words and auto-format your text. 🔵 It recognizes custom vocabulary so the model knows unique names and product titles. 🔵 It automatically detects and transcribes speech in 85+ languages. Try it now in the @Geminiapp on macOS and Gboard on @Android. Start building in @GoogleAIStudio and @Antigravity → goo.gle/4gzP1K8

中文翻译:主要更新包括:即使在嘈杂环境中,也能更好识别复杂电话号码、邮政编码和订单号;能够删除填充词并自动整理文本格式;支持自定义词汇,从而识别专有名称和产品名;可自动检测并转写 85 种以上语言。用户可在 macOS 版 Gemini 应用和 Android 的 Gboard 中体验,开发者可从 Google AI Studio 与 Antigravity 开始构建。

这次发布解决什么问题

语音转写的难点不只是把普通句子变成文字。真实业务录音常含噪声、口音、代码切换、数字与字母混合标识,以及不能被通用词表覆盖的产品名。Google DeepMind 在原帖中强调的改进,正对应这些常见失败点:噪声环境下的结构化实体识别、可配置词汇、自动断句与格式化,以及多语言自动识别。

据 Google 官方技术说明,开发接口分为两种:gemini-3.5-transcribe-live 通过 Live API 处理实时流,目标是亚秒级延迟;gemini-3.5-transcribe 通过 Interactions API 处理预录音频,并提供说话人区分和词级时间戳。官方还表示可处理 85 种以上语言,稳定支持最多 3 位说话人;更多说话人的场景仍属实验性能力。

可核实结果与验证方式

官方文章引用 Artificial Analysis 的评测称,流式与非流式模式的平均词错误率(WER)分别为 4.0% 和 2.6%;在 FLEURS 基准上分别为 5.50% 和 5.04%。官方还称相较 Chirp 3,实时模式的最终结果确认时间改善 70%。这些都是发布方整理的结果,并不等于所有口音、行业词汇和噪声条件下都能复现。

实际接入时,建议用自己的录音集分别测量:

  1. 普通话、方言、英语及中英混说的 WER/CER;
  2. 电话号码、地址、订单号和专有名词的字段级准确率;
  3. 首字延迟、最终结果延迟及流式修订次数;
  4. 多说话人切分与词级时间戳偏差;
  5. 开启和关闭自定义词汇、填充词清理后的差异。

原始 X 线程没有说明完整评测集、提示词、音频采样率、噪声构造方式或逐项复现实验步骤;官方文章也没有给出足以一键复现全部数字的配置。因此,以上指标应视为选型线索,生产采用前仍需以业务数据做盲测。

适用边界

  • 自动删除填充词和自动格式化适合会议纪要与客服摘要,但法律、医疗、取证等需要保留原始口语特征的场景,应确认这些处理是否可关闭,并保留原始音频。
  • “85+ 语言”不代表每种语言、口音或代码切换组合具有相同质量;长尾语言需要单独测试。
  • 最多 3 位说话人的稳定支持不适合直接外推到大型会议。
  • 模型目前通过 Gemini API、Google AI Studio 和 Gemini Enterprise Agent Platform 提供公开预览;预览期接口、价格、限额和行为仍可能变化。
  • 原帖中的能力描述属于发布方陈述;Codex 的归纳是:它更适合作为需要实时延迟、结构化实体和多语言支持的候选方案,而不是无需验证即可替换现有转写系统的结论。

原作者:Google DeepMind(@GoogleDeepMind),2026 年 8 月 26 日
原帖:Google DeepMind on X: "Gemini 3.5 Transcribe is our latest speech-to-text model for precise and intelligent transcriptions. 🧵" / X