OpenAI Developers 介绍 GPT-Live-1,可在说话的同时监听,通话者能随时打断、补充细节或中途改变方向。Yelp 正在用它让餐厅预订电话更自然,官方发布了演示视频。
#语音
#语音
今日 0 条
OpenAI Developers@OpenAIDevsAI 评分5353
OpenRouter:Announcements(RSS)AI 评分5656 OpenRouter 文本转语音 API 五分钟教程
OpenRouter 通过 OpenAI 兼容的 POST /api/v1/audio/speech 端点提供文本转语音服务,一个 API key 可调用多家供应商的 TTS 模型。
OpenBMB@OpenBMBAI 评分5757
OpenAI Developers@OpenAIDevsAI 评分6767OpenAI 宣布 GPT-Live-1 现已在 API 中可用。开发者可在应用中引入 ChatGPT 式自然对话体验,语音智能体可在说话的同时聆听,并支持搭配用户自选的模型和 harness。
OpenAI:官网动态(RSS · 排除企业/客户案例)精选AI 评分7070 OpenAI 在 API 中推出全双工语音模型 GPT-Live-1
OpenAI 在 API 中发布语音模型 GPT-Live-1,可同时听和说,支持将推理和工具调用委派给 GPT-6 Astra 等后端模型,前端语音层定价为每分钟 $0.05。
推荐理由:原文给出单模型全双工语音架构、基准变化和定价,读者可以据此评估它能否简化现有语音 Agent 的分层方案。
Tencent Hy@TencentHunyuanAI 评分5959
Suno@suno精选AI 评分6666Suno 发布 v6 模型,可将图片、视频和语音备忘录转化为音乐,并对已创建的歌曲进行精确修改。同时提供 v6-wild 版本供探索更多可能性,官方附有 2 分钟以内的功能演示视频。
推荐理由:官方宣布 v6 上线并给出多模态输入与歌曲精修能力,可据此了解音乐生成模型的最新变化。
Baseten 工程博客(网页)AI 评分3838 Baseten 如何让 pyannote 的说话人分离模型提速 9.6 倍
Baseten 优化了 pyannote 最新的开源模型 Community-1 与闭源模型 Precision-2,长音频延迟最高提升 9.6 倍,Precision-2 吞吐量提升 3.2 倍。
Microsoft AI:官方博客(网页)精选AI 评分6464 Microsoft AI 发布语音识别模型 MAI-Transcribe-2
Microsoft AI 发布转录模型 MAI-Transcribe-2,称其在 FLEURS 基准 60 种语言上平均词错率 5.2% 排名第一,并占据 Artificial Analysis 准确率-延迟 Pareto 前沿。
推荐理由:官方给出具体基准排名、对比速度倍数和定价,读者可以据此评估它对现有语音转写方案的可替换性。
OpenRouter@OpenRouterAI 评分5151
Artificial Analysis@ArtificialAnlysAI 评分5656Sierra:Blog(RSS)AI 评分3232 Sierra 发布企业级语音 AI 指南,详解 AI 语音智能体与七项通话就绪测试
Sierra 发布企业级语音 AI 指南,讲解企业语音 AI 的工作原理,并提出七项通话就绪测试。测试覆盖听觉、延迟、动作、护栏与人工转接五个维度,用于评估 AI 语音智能体。
Artificial Analysis@ArtificialAnlysAI 评分5959
Google Blog:AI(RSS)AI 评分5252 Google 发布 Gemini 3.7 Flash、Gemini 3.5 Transcribe 和 Pixel 11 系列等八月 AI 更新
Google 发布八月 AI 更新汇总:推出面向编码和 Agent 的工作模型 Gemini 3.7 Flash,价格为 Gemini 3.6 Flash 推出价的一半每百万 token。
Artificial Analysis@ArtificialAnlysAI 评分6161
AI at Meta@AIatMetaAI 评分6262
OpenBMB@OpenBMBAI 评分4646
OpenBMB@OpenBMBAI 评分2626Meta 官方精选AI 评分7070 Muse Voice Transcribe 发布,实时转写支持多说话人与语言切换
Muse Voice Transcribe 提供流式语音识别、说话人区分和端点检测,已用于 Meta AI、Muse Code 并通过模型 API 提供。模型训练覆盖七十多种语言,其中二十五种经过深入验证;支持语言切换不代表所有语言质量完全相同。
推荐理由:实时转写同时输出说话人和语言变化,为会议及编程助手保留对话结构,便于后续检索和任务处理。
Google DeepMind精选AI 评分7171 Google 发布 Gemini 3.5 Transcribe 语音转文字模型
Google 发布 Gemini 3.5 Transcribe,称其为目前最精确的语音转文字模型,可将原始音频直接转为准确、格式化文本。据 Artificial Analysis 测量,流式场景平均词错误率 4.0%,非流式 2.6%;相比上一代 Chirp 3,最终转写时间改善 70%,FLEURS 基准上流式 WER 为 5.50%、非流式为 5.04%。
推荐理由:Gemini 3.5 Transcribe 的 WER、延迟与多语言数据,可用来判断实时语音转写当前的能力水位。
Google DeepMindAI 评分5858 Google DeepMind 在 Flow Music 发布音乐生成模型 Lyria 3.5
Google DeepMind 发布音乐生成模型 Lyria 3.5,并当天在 Google Flow Music 上线。新版本在旋律结构、歌词质量与提示词遵循、人声表现力与发音上均有提升,同时让用户更易控制输出的节奏与时长。
Google DeepMind精选AI 评分7878 Google DeepMind 发布 Gemini 3.5 Live Translate 实时语音翻译模型
Google DeepMind 发布音频模型 Gemini 3.5 Live Translate,可自动检测 70+ 语言并生成保留说话人语调、节奏和音高的近实时语音翻译,全程仅落后说话人数秒。
推荐理由:Gemini 3.5 Live Translate 支持 70+ 语言连续语音翻译,并同步开放 API、Meet 与 Translate 入口,可据此判断实时翻译的落地节奏。
Google DeepMind精选AI 评分6262 Google DeepMind 发布 AI co-clinician 医疗智能体研究
Google DeepMind 宣布 AI co-clinician 研究计划,探索 AI 智能体在医生临床监督下协助患者诊疗。
推荐理由:Google DeepMind 公开 AI co-clinician 研究,给出医生盲评与实时多模态模拟的对比结果,可了解医疗智能体当前的能力边界。
Google DeepMind精选AI 评分7171 Google DeepMind 发布 Gemini 3.1 Flash TTS 语音模型
Google DeepMind 发布 Gemini 3.1 Flash TTS 文本转语音模型,在 Artificial Analysis TTS 榜单上取得 1,211 Elo 分数,并支持 70 多种语言和原生多说话人对话。
推荐理由:官方给出 Gemini 3.1 Flash TTS 的 Elo 分数、音频标签控制方式和多平台开放入口,可据此判断语音生成的可控性变化。