xAI 旗下 Grok Voice Transcribe 2.0 语音转文本 API 发布,宣称准确率为 1.0 的两倍且价格不变
SpaceXAI 发布语音转文本模型 Grok Voice Transcribe 2.0,宣称准确率是 1.0 的两倍,价格不变,批量每小时 $0.10、流式每小时 $0.20。
SpaceXAI 发布语音转文本模型 Grok Voice Transcribe 2.0,宣称准确率是 1.0 的两倍,价格不变,批量每小时 $0.10、流式每小时 $0.20。
印度电信监管局 TRAI 修订规则,要求允许用户标记骚扰电话的来电识别和通话管理应用,将用户举报提交至运营商维护的基于区块链的平台。
xAI 发布 Grok Voice Transcribe 2.0 语音转写模型,官方称在真实场景评测中准确率是 1.0 的两倍且价格不变。在 Artificial Analysis 公开榜单上,它在 32 个 streaming 模型中准确率排名第一;多语言能力提升最大,短短语集合上词错误率从 20.6% 降至 6.8%。
推荐理由:原文给出公开榜单排名、内部错误率数字和与 1.0 同价的定价,读者可据此评估迁移成本与实际收益。
Qwen 发布 Qwen3.8-LiveTranslate,采用 Interleave 架构与 Hybrid-MoE Thinker–Talker 设计重构实时同声传译,平均滞后(LAAL)从上一代的 2.8 秒降至 2.3 秒。
推荐理由:官方给出了架构设计、LAAL 从 2.8 秒到 2.3 秒的数字和多语言评测结果,读者可以据此评估其实时翻译能力的实际变化。
Qwen 发布下一代原生全模态模型 Qwen3.8-Omni-Flash,支持文本、图像、音频和视频输入及 1M token 上下文窗口,29 项评测平均分较 Qwen3.5-Omni-Plus 提升超过 25%,音频输入每小时价格下降超过 98%,音视频输入每小时价格下降超过 93%。
推荐理由:官方发布同时开放 API 和开源插件与运行时,读者可以据此评估音视频智能体在剪辑、会议、实时交互等工作流中的落地方式。
Google 在 Gemini API 和 Google AI Studio 发布 Gemini 3.8 Live 与 3.8 Live Extended Thinking 语音模型,支持异步函数调用、视觉上下文、97+ 语言和可配置思考,Extended Thinking 版位列 Artificial Analysis 语音到语音榜单第一。
科大讯飞上线语音基座大模型 Spark-Audio-1.0-Preview,采用 0.65B Dense 音频编码器搭配 30B-A3B MoE 大语言模型,使用 1300 万小时音频数据基于纯国产算力集群训练。
蚂蚁集团 inclusionAI 在 Hugging Face 发布 Realtime-Venus,包含 Realtime-Venus-Omni 和 Realtime-Venus-Audio 两个 9B 检查点,基于 MiniCPM-o 4.5 / Omni-Flow 架构,语言骨干为 Qwen3-8B。
蚂蚁集团 Venus 团队与清华大学在 GitHub 开源 Realtime-Venus,一个支持全双工对话与异步任务委托的实时交互系统。系统包含三个组件:Realtime-Venus-Omni(9B,流式音视频对话与主动交互)、Realtime-Venus-Audio(9B,语音交互与音频理解)以及负责后台任务执行并将结果返回同一对话的 Harness 运行时。
推荐理由:蚂蚁和清华开源了全双工对话加异步委托任务的系统,含 9B 的 Omni 与 Audio 两个模型和 Harness 运行时,可直接下载推理或跑浏览器 demo。
努比亚发布 NaviX Ultra 手机,宣称是首款 AI 智能体手机,售价 5999 元起,国补后 5499 元起。该机由豆包手机助手主导 AI 体验,搭载 Seed 全双工语音大模型和第五代骁龙 8 至尊版,支持一句话跨应用执行任务,端到端任务成功率超 80%,AI 唤醒率优于竞品 48%,并完成智能体大模型备案。
vivo 在 2026 开发者大会上发布四款蓝心大模型,包括端到端 MoE 架构的 BlueLM-RealTime、30 亿参数的 BlueLM-Nano 和搭载自研 Agentic 引擎的 BlueLM-Flash / Pro。同时推出系统级蓝心 Harness,深入原系统内核层,已增加 6000 多项原子技能,支持超万种任务,并预研蓝心 30B MoE 端侧大模型。
Google 发布 Gemini 3.8 Live 和 3.8 Live Extended Thinking 两个语音到语音模型,形态类似 OpenAI 的 GPT-Live 模型。
谷歌于 9 月 15 日推出 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking 两款实时对话模型,前者面向规模化部署与成本优化,后者面向高复杂度任务、强化多步推理。
Google 发布 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking 两款原生语音到语音对话模型,已在 Gemini Live API 和 Google AI Studio 上线,托管形式不提供开放权重。
Google 发布 Gemini 3.8 Live 与 Gemini 3.8 Live Extended Thinking 两款近实时语音对话模型,分别面向规模化成本效率和高复杂度多步推理任务。
Google DeepMind 发布 Gemini 3.8 Live 和 3.8 Live Extended Thinking 两款开发者语音模型,可通过 Gemini API 和 Google AI Studio 使用。
Google DeepMind 发布 Gemini 3.8 Live 与 Gemini 3.8 Live Extended Thinking 两个近实时语音对话模型,主打语音智能体和复杂任务执行。
推荐理由:原文给出两个语音对话模型的定位分工和多项基准数字,读者可以据此评估其推理、成本与工具调用能力。
Google AI 发布迄今最先进的 Gemini 音频模型 Gemini 3.8 Live 与 3.8 Live Extended Thinking。
阶跃星辰发布 StepAudio 3 系列语音模型,包括 StepAudio3Realtime、StepAudio3ASR、StepAudio3TTS、StepAudio3Gen 和 StepAudio3Music,均已上线阶跃星辰开放平台。
阶跃星辰发布 StepAudio 3 系列,包含 Realtime、ASR、TTS、Gen 和 Music 五款模型,已在阶跃星辰开放平台上线。
推荐理由:官方完整介绍了五款模型的能力与榜单成绩,可帮助读者了解语音模型在实时交互、理解和创作上的进展。
推荐理由:原文给出语音到语音模型的完整分数、速度和成本对比,读者可据此在不同后端配置间做选型判断。
豆包手机助手消费者版 9 月 14 日正式发布,主打稳定性与交互体验,支持 AI 键(带指纹鉴权)、语音唤醒、屏幕问答、本地数据搜索和接入飞书妙记的录音体验。Beta 形式开放操作手机功能,并推出屏幕自动化操作声明协议 SAEP,第三方应用可声明允许或拒绝 AI 自动化操作,同步启动 30 天规则公示。首个消费者版将搭载于努比亚 NaviX Ultra,9 月 16 日发售。
ElevenLabs 为 ElevenMusic 发布 Music v2.5,称生成歌曲更饱满自然;在 47,885 组盲测对比中听众多数时候更偏好 v2.5,尤其是 R&B、Soul、Hip-Hop、Rock 和管弦乐。
Suno 发布新一代音乐模型 v6,与 Warner Music Group、BMG、Believe 等行业伙伴合作开发,后续将全面替换旧模型。v6 分为三个版本:旗舰 v6 和探索向的 v6-wild 面向 Pro 与 Premier 订阅用户,更快的 v6-mini 向所有人开放。
推荐理由:官方发布新一代音乐模型,给出三个版本的定位差异和编辑、混音、采样等具体新能力,可帮助创作者判断如何选择和使用。
StepAudio 3 Realtime 是一个围绕听-说-想-做循环组织的音频语言基础模型,通过 Deep Perception 解读声学线索,Seamless Duplex 处理停顿、附和与打断。