跳到正文

#语音

今日 0 条
9月12日周六
9月11日周五
  1. OpenAI:官网动态(RSS · 排除企业/客户案例)70

    OpenAI 在 API 中推出全双工语音模型 GPT-Live-1

    OpenAI 在 API 中发布语音模型 GPT-Live-1,可同时听和说,支持将推理和工具调用委派给 GPT-6 Astra 等后端模型,前端语音层定价为每分钟 $0.05。

    推荐理由:原文给出单模型全双工语音架构、基准变化和定价,读者可以据此评估它能否简化现有语音 Agent 的分层方案。

9月10日周四
9月4日周五
9月3日周四
  1. Microsoft AI:官方博客(网页)64

    Microsoft AI 发布语音识别模型 MAI-Transcribe-2

    Microsoft AI 发布转录模型 MAI-Transcribe-2,称其在 FLEURS 基准 60 种语言上平均词错率 5.2% 排名第一,并占据 Artificial Analysis 准确率-延迟 Pareto 前沿。

    推荐理由:官方给出具体基准排名、对比速度倍数和定价,读者可以据此评估它对现有语音转写方案的可替换性。

9月2日周三
9月1日周二
  1. Meta 官方70

    Muse Voice Transcribe 发布,实时转写支持多说话人与语言切换

    Muse Voice Transcribe 提供流式语音识别、说话人区分和端点检测,已用于 Meta AI、Muse Code 并通过模型 API 提供。模型训练覆盖七十多种语言,其中二十五种经过深入验证;支持语言切换不代表所有语言质量完全相同。

    推荐理由:实时转写同时输出说话人和语言变化,为会议及编程助手保留对话结构,便于后续检索和任务处理。

8月27日周四
  1. Google DeepMind71

    Google 发布 Gemini 3.5 Transcribe 语音转文字模型

    Google 发布 Gemini 3.5 Transcribe,称其为目前最精确的语音转文字模型,可将原始音频直接转为准确、格式化文本。据 Artificial Analysis 测量,流式场景平均词错误率 4.0%,非流式 2.6%;相比上一代 Chirp 3,最终转写时间改善 70%,FLEURS 基准上流式 WER 为 5.50%、非流式为 5.04%。

    推荐理由:Gemini 3.5 Transcribe 的 WER、延迟与多语言数据,可用来判断实时语音转写当前的能力水位。

7月30日周四
6月9日周二
  1. Google DeepMind78

    Google DeepMind 发布 Gemini 3.5 Live Translate 实时语音翻译模型

    Google DeepMind 发布音频模型 Gemini 3.5 Live Translate,可自动检测 70+ 语言并生成保留说话人语调、节奏和音高的近实时语音翻译,全程仅落后说话人数秒。

    推荐理由:Gemini 3.5 Live Translate 支持 70+ 语言连续语音翻译,并同步开放 API、Meet 与 Translate 入口,可据此判断实时翻译的落地节奏。

4月30日周四
4月16日周四
  1. Google DeepMind71

    Google DeepMind 发布 Gemini 3.1 Flash TTS 语音模型

    Google DeepMind 发布 Gemini 3.1 Flash TTS 文本转语音模型,在 Artificial Analysis TTS 榜单上取得 1,211 Elo 分数,并支持 70 多种语言和原生多说话人对话。

    推荐理由:官方给出 Gemini 3.1 Flash TTS 的 Elo 分数、音频标签控制方式和多平台开放入口,可据此判断语音生成的可控性变化。