Realtime-Venus:支持异步委托的全双工交互系统
论文提出 Realtime-Venus 全双工交互系统,包含两个独立训练的 9B 模型,Realtime-Venus-Omni 负责音视频交互,Realtime-Venus-Audio 负责语音交互。
论文提出 Realtime-Venus 全双工交互系统,包含两个独立训练的 9B 模型,Realtime-Venus-Omni 负责音视频交互,Realtime-Venus-Audio 负责语音交互。
OpenAI Developers 介绍 GPT-Live-1,可在说话的同时监听,通话者能随时打断、补充细节或中途改变方向。Yelp 正在用它让餐厅预订电话更自然,官方发布了演示视频。
OpenRouter 通过 OpenAI 兼容的 POST /api/v1/audio/speech 端点提供文本转语音服务,一个 API key 可调用多家供应商的 TTS 模型。
小米发布并开源工业级目标说话人语音识别大模型 Xiaomi-CocktailASR-1,针对多人同时说话时识别率大幅下降的鸡尾酒会难题。模型采用端到端 LLM 架构,以目标说话人参考音频作为声纹提示,在多个主流多说话人测试集上达到 SOTA;单人识别性能比肩标准 ASR 模型,可拒识非目标说话人并支持思维链推理模式。代码开源于 GitHub 和 HuggingFace。
OpenAI 宣布 GPT-Live-1 上线 API,支持全双工对话、处理打断与背景噪声,可用于电话语音智能体,并将语音理解与输出整合在同一模型中以降低延迟。
GPT-Live-1 现已登陆 OpenAI API。开发者可将 ChatGPT 式自然对话带入应用,构建能边说边听的语音智能体,并自选所用的模型与 harness。
OpenAI 将语音模型 GPT-Live-1 以 API 形式开放给开发者,支持全双工同时听和说,价格为每分钟 $0.05。相比 GPT-Realtime-2.1,其全双工交互测试得分 80.1% 对 45.4%,轮次延迟从 1.4 秒降至 0.8 秒,工具调用准确率从 60% 升至 87%,银行语音支持基准通过率从 12.4% 升至 32%。
OpenAI 宣布 GPT-Live-1 现已在 API 中可用。开发者可在应用中引入 ChatGPT 式自然对话体验,语音智能体可在说话的同时聆听,并支持搭配用户自选的模型和 harness。
OpenAI 在 API 中发布语音模型 GPT-Live-1,可同时听和说,支持将推理和工具调用委派给 GPT-6 Astra 等后端模型,前端语音层定价为每分钟 $0.05。
推荐理由:原文给出单模型全双工语音架构、基准变化和定价,读者可以据此评估它能否简化现有语音 Agent 的分层方案。
Apple 在 Apple Watch Series 12 和 Ultra 4 上推出 Audio Intelligence 功能 Siri Recaps,可总结一天中的对话,用户可按计划或在 Smart Stack 顶部开关。
作者实测网易有道新上线的语音输入法叭哥说,与 Typeless、豆包输入法、闪电说横向对比。叭哥说采用双模型分工,E2E 平均 1683ms、P95 2134ms,并支持小声拾音、个人词典即刻生效和多语言翻译等功能。
OpenAI 语音产品负责人 Atty Eleti 宣布 ChatGPT 语音模式可自由选择模型和推理深度,Pro 套餐可调用 GPT-5.6 Sol 或 GPT-6 Astra,语音模式在需要搜索或复杂推理时自动调用指定模型。
Suno 发布 v6 模型,可将图片、视频和语音备忘录转化为音乐,并对已创建的歌曲进行精确修改。同时提供 v6-wild 版本供探索更多可能性,官方附有 2 分钟以内的功能演示视频。
推荐理由:官方宣布 v6 上线并给出多模态输入与歌曲精修能力,可据此了解音乐生成模型的最新变化。
Suno 发布 v6 AI 音乐模型,是首个获得唱片业支持的版本,训练数据包含来自 Warner Music Group、BMG 和 Believe 的授权内容及用户数据。
Baseten 优化了 pyannote 最新的开源模型 Community-1 与闭源模型 Precision-2,长音频延迟最高提升 9.6 倍,Precision-2 吞吐量提升 3.2 倍。
欧洲 AI 实验室 Desert Ant Labs 正式成立并上线首批 18 个端侧专用模型(12 个稳定版、6 个 beta),覆盖音频、视觉和文本任务,通过 Swift、Kotlin 和 JavaScript 的统一 SDK 提供,在 GitHub 和 Hugging Face 开放。
巴黎语音 AI 公司 Gradium(从 Kyutai 研究实验室分拆)推出 Voice Design,输入 1 到 500 字符的描述即可在 3 到 5 秒内生成 1 到 5 个候选语音,无需参考音频,支持英法西葡德 5 种语言,已在 Gradium API 和 Studio 全部套餐免费开放。
作者发布 Gander 技术报告,这是一个端到端模型,在单一框架内统一全模态感知、实时交互与智能体能力,支持视频、语音、文本流式输入与随时打断的全双工交互。其采用 Cerebellum-Brain 协同框架,小脑负责实时交互与对话,大脑负责复杂推理与智能体任务,并基于流式 Thinker-Talker 架构实现低延迟;模型、代码和数据将开源。
Meta Superintelligence Labs 发布首个实时音频感知模型 Muse Voice Transcribe,将音频切分为 80 毫秒块,通过强化学习为每个词动态调整等待时间,并内置说话人区分(可同时区分 20 人以上)和句界检测。
谷歌于 9 月 5 日宣布在 Gemini 应用和 Gemini API 中上线音乐生成模型 Lyria 3.5,可生成含数段副歌、桥段等数分钟完整歌曲,用户可通过 gemini.google.com/music 网站和应用使用。
OpenAI Codex 在已有线程中上线语音功能,可在桌面端任意线程开启。用户可与编写 PR 的智能体语音讨论、辩论架构或商量后续计划,沟通结束后让智能体继续工作。
Suno 发布推文「Soon enough, you'll hear it all.」,并附一段视频,暗示即将推出与听觉相关的新内容,但未给出产品名称、发布时间或具体功能细节。
Ugreen 在 IFA 展会发布 HomeAgent 智能家居平台,将 NAS、监控 NVR 和端侧 AI 整合到一个中枢中,由语音助手 Uliya 管理,宣称数据全部本地处理、无月费。
人人影视更名为“人人影视分享精彩”,App 已在安卓端上线、iOS 端筹备完成,运营方为分享精彩网络科技(嘉兴)有限公司,负责人李渊敏称本月起点对点推广、力争激活 3000 万存量用户。平台依托 7 万余集影视素材样本打造 AI 影视本地化技术,实现角色音色克隆,计划覆盖 50 余个国家和地区,优先面向东南亚输出国产影视内容,片源与华数传媒合作正版购买,目前处于前期公测、月底正式发布。
微软 9 月 3 日发布语音转文字模型 MAI-Transcribe-2,称其是自家最快、最准确、最便宜的转录模型,支持 60 种语言。
HojoAI 的 Hojo-ASR-Multi-V1 正式上线 Open ASR Leaderboard,全球排名第 7、开源多语言 ASR 第 1,五语言平均 WER 3.54%。
Google 开始向全球移动端推出 Gmail Live、Docs Live 和 Keep Live 三项 AI 语音功能,支持免手操作查询信息、总结和转录。Gmail Live 可从收件箱口头回答问题并附邮件来源链接,Docs Live 能把口述需求整理成结构化文档并可在授权后调用 Gmail、Drive、Chat 和网页信息,Keep Live 支持自然语言记录笔记。
Microsoft AI 发布转录模型 MAI-Transcribe-2,称其在 FLEURS 基准 60 种语言上平均词错率 5.2% 排名第一,并占据 Artificial Analysis 准确率-延迟 Pareto 前沿。
推荐理由:官方给出具体基准排名、对比速度倍数和定价,读者可以据此评估它对现有语音转写方案的可替换性。