微软 AI 发布面向语音智能体的转写与语音合成模型
微软 AI 发布实时转写模型 MAI-Transcribe-2-Streaming,称其在 Artificial Analysis 准确率排名第一,支持 60 种语言,首个部分结果延迟略超 100 毫秒,年底前音频价格为每小时 0.54 美元。
微软 AI 发布实时转写模型 MAI-Transcribe-2-Streaming,称其在 Artificial Analysis 准确率排名第一,支持 60 种语言,首个部分结果延迟略超 100 毫秒,年底前音频价格为每小时 0.54 美元。
Tavus 推出名为 Griffin 的 Human Interaction Model,可在实时视频通话中同时接收和生成语音、面部表情、语气、手势与停顿。
ElevenLabs 发布 Eleven v4 语音模型,更准确地跟随情感、停顿等方向提示,支持超过 90 种语言(v3 约为 70 种),单次可处理 10,000 字符,发音基准得分从 v3 的 85.6% 升至 91.7%。
阿里 Qwen 团队发布 Qwen-Audio-3.1 系列 5 个音频模型,主力为面向语音智能体的全双工模型 qwen-audio-3.1-realtime-plus,通过 QwenCloud API 以 WebSocket 提供,未开源权重,并对 Realtime、TTS、ASR 分别降价约 85%、70% 和最高 95%。
ElevenLabs 于当地时间周一发布 v4 与 v4 Turbo 两款语音模型,强化情绪表达控制、降低响应延迟,语言支持从 70 种提升至 90 余种,用户仅需 10 秒音频素材即可完成声音克隆。
Google 发布 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款语音生成模型,前者面向游戏、互动娱乐和长篇旁白,后者面向自动配音、对话智能体和高吞吐翻译流水线。
Google 发布 Gemini 3.8 Flash TTS 和 Flash-Lite TTS 两款文本转语音模型,已通过 Gemini API 和 Google AI Studio 提供。
NVIDIA 在 Hugging Face 发布开源权重模型 Nemotron 3 Diarization,参数量 100M,可实时追踪最多 8 个说话人并处理语音重叠,采用 OpenMDW License 1.1 许可证允许商用。
Google 发布 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款文本转语音模型,支持用自然语言提示词从零设计声音、30 秒音频样本复刻声音、逐行台词表演控制、原生双说话人场景编排,覆盖超过 100 种语言和方言。
谷歌发布 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款文本转语音模型,支持逐行控制台词演绎、100 多种语言和 2000 多种现成语音。
Google DeepMind 发布 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款文本转语音模型,支持用自然语言提示词从零设计声音、30 秒样本复刻声音,并提供逐行表演指导、长时音频生成和双说话人场景编排,覆盖 100 多种语言。
推荐理由:官方介绍了两款 TTS 模型的能力细节、评测名次和开放入口,开发者可以据此评估语音生成工作流的选型。
Google 发布 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两个文生语音模型,支持预设音色和声音复刻。
推荐理由:官方一次性给出五个音频模型的能力细节和三档降价幅度,读者可对照自身场景评估替换成本。
千问发布 Qwen-Audio-3.1 系列语音大模型,包含 ASR、ASR-Next、TTS、TTS-Next 和 Realtime 五款模型,覆盖语音识别、合成、实时交互和音频创作。
Kyutai 发布 Voice of Reason,两个基于 GLM-4-Voice-9B 的开源权重语音到语音模型,无需转写和独立文本 LLM 即可口头解数学题。
腾讯混元语音团队联合多所高校发布 Gander 模型,用"小脑"负责实时对话、可替换的"大脑"处理后台智能体任务(测试中用 GPT-5.6 家族模型),可同时处理语音、图像和文本并随时被打断。
通义千问(Qwen)发布实时同声传译模型Qwen3.8-LiveTranslate,采用新的Interleave架构,平均滞后(LAAL)从2.8秒降至2.3秒,约降低18%。
当地时间 9 月 18 日,SpaceXAI 发布 Grok Voice Transcribe 2.0 语音转文本模型,在价格不变的前提下错误率降低约一半。该模型基于 Grok Voice 底层音频基础模型构建,在 Artificial Analysis 全部 32 款流式模型中准确率居首;官方四个内部数据集评测均超越 1.0 版本。
阿里千问发布同声传译大模型 Qwen3.8-LiveTranslate,基于 Hybrid MoE 的 Thinker–Talker 双模块设计,以 Interleave 架构重构实时同传,字均延迟(LAAL)从 2.8 秒降至 2.3 秒。
Qwen 发布 Qwen3.8-LiveTranslate,采用 Interleave 架构与 Hybrid-MoE Thinker–Talker 设计重构实时同声传译,平均滞后(LAAL)从上一代的 2.8 秒降至 2.3 秒。
推荐理由:官方给出了架构设计、LAAL 从 2.8 秒到 2.3 秒的数字和多语言评测结果,读者可以据此评估其实时翻译能力的实际变化。
Qwen 发布下一代原生全模态模型 Qwen3.8-Omni-Flash,支持文本、图像、音频和视频输入及 1M token 上下文窗口,29 项评测平均分较 Qwen3.5-Omni-Plus 提升超过 25%,音频输入每小时价格下降超过 98%,音视频输入每小时价格下降超过 93%。
推荐理由:官方发布同时开放 API 和开源插件与运行时,读者可以据此评估音视频智能体在剪辑、会议、实时交互等工作流中的落地方式。
Google 在 Gemini API 和 Google AI Studio 发布 Gemini 3.8 Live 与 3.8 Live Extended Thinking 语音模型,支持异步函数调用、视觉上下文、97+ 语言和可配置思考,Extended Thinking 版位列 Artificial Analysis 语音到语音榜单第一。
科大讯飞上线语音基座大模型 Spark-Audio-1.0-Preview,采用 0.65B Dense 音频编码器搭配 30B-A3B MoE 大语言模型,使用 1300 万小时音频数据基于纯国产算力集群训练。
蚂蚁集团 inclusionAI 在 Hugging Face 发布 Realtime-Venus,包含 Realtime-Venus-Omni 和 Realtime-Venus-Audio 两个 9B 检查点,基于 MiniCPM-o 4.5 / Omni-Flow 架构,语言骨干为 Qwen3-8B。
vivo 在 2026 开发者大会上发布四款蓝心大模型,包括端到端 MoE 架构的 BlueLM-RealTime、30 亿参数的 BlueLM-Nano 和搭载自研 Agentic 引擎的 BlueLM-Flash / Pro。同时推出系统级蓝心 Harness,深入原系统内核层,已增加 6000 多项原子技能,支持超万种任务,并预研蓝心 30B MoE 端侧大模型。
Google 发布 Gemini 3.8 Live 和 3.8 Live Extended Thinking 两个语音到语音模型,形态类似 OpenAI 的 GPT-Live 模型。
谷歌于 9 月 15 日推出 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking 两款实时对话模型,前者面向规模化部署与成本优化,后者面向高复杂度任务、强化多步推理。
Google 发布 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking 两款原生语音到语音对话模型,已在 Gemini Live API 和 Google AI Studio 上线,托管形式不提供开放权重。
Google 发布 Gemini 3.8 Live 与 Gemini 3.8 Live Extended Thinking 两款近实时语音对话模型,分别面向规模化成本效率和高复杂度多步推理任务。
Google DeepMind 发布 Gemini 3.8 Live 和 3.8 Live Extended Thinking 两款开发者语音模型,可通过 Gemini API 和 Google AI Studio 使用。