跳到正文
原文
Google DeepMind·· 2026-08-27精选AI 评分71

Google 发布 Gemini 3.5 Transcribe 语音转文字模型

Intelligent transcription with Gemini 3.5 Transcribe

AI 导读

Google 发布 Gemini 3.5 Transcribe,称其为目前最精确的语音转文字模型,可将原始音频直接转为准确、格式化文本。据 Artificial Analysis 测量,流式场景平均词错误率 4.0%,非流式 2.6%;相比上一代 Chirp 3,最终转写时间改善 70%,FLEURS 基准上流式 WER 为 5.50%、非流式为 5.04%。

推荐理由

Gemini 3.5 Transcribe 的 WER、延迟与多语言数据,可用来判断实时语音转写当前的能力水位。

来源:Google DeepMind · deepmind.google