推荐理由:官方宣布 ChatGPT Voice 接入插件和新模型并支持语音驱动工作流,读者可据此了解语音能力扩展到哪些日常任务。
#语音
#语音
今日 0 条
OpenAI@OpenAI精选AI 评分7272The Verge:AI(RSS)AI 评分6060 Meta 在 Connect 2026 发布无摄像头的 Ray-Ban Meta Audio Glasses 并更新 Gen 3 眼镜
Meta 在 Meta Connect 2026 上推出无摄像头、内置 Meta AI 的 Ray-Ban Meta Audio Glasses,起价 349 美元,重量从 43 克起,续航约 12 小时,支持通话、听播客和音乐。
Simon Willison 博客AI 评分6767 Google 发布 gemini-3.8-flash-tts 与 flash-lite-tts 两款语音合成模型
Google 发布两款新的 Gemini 语音合成模型 gemini-3.8-flash-tts 和 gemini-3.8-flash-lite-tts,内置超过 2,000 个声音,支持用 30 秒音频样本创建自定义声音。
MarkTechPost(RSS)AI 评分5757 Google 发布 Gemini 3.8 Flash TTS 和 Flash-Lite TTS,支持提示词语音设计
Google 发布 Gemini 3.8 Flash TTS 和 Flash-Lite TTS 两款文本转语音模型,已通过 Gemini API 和 Google AI Studio 提供。
Rohan Paul@rohanpaul_aiAI 评分7070The Decoder:AI News(RSS)AI 评分7272 ChatGPT Voice 升级并首次接入邮件、日历和 Slack 插件
OpenAI 的 ChatGPT Voice 获得重大升级,全球可用的语音功能现已运行在新的 GPT-6 Astra、Sol 和 Luna 模型上,并首次可访问邮件、日历和 Slack 等插件。
TechCrunch:AI(RSS)AI 评分5858 OpenAI 在 ChatGPT 移动端推出语音触发的智能体功能
OpenAI 宣布为 ChatGPT 移动端带来语音触发的智能体功能,用户可用语音让模型起草文档、总结邮件等。Plus 和 Pro 用户可在手机 Work 标签页创建文档、草拟邮件、总结 Slack 消息,还能建站、做演示文稿、使用云端浏览器和财务功能;Free 和 Go 用户可使用插件和已连接应用。
MarkTechPost(RSS)AI 评分5858 NVIDIA 发布开源说话人分离模型 Nemotron 3 Diarization,支持实时追踪 8 个说话人
NVIDIA 在 Hugging Face 发布开源权重模型 Nemotron 3 Diarization,参数量 100M,可实时追踪最多 8 个说话人并处理语音重叠,采用 OpenMDW License 1.1 许可证允许商用。
Greg Brockman@gdbAI 评分7777The Decoder:AI News(RSS)AI 评分7070 Google 发布 Gemini 3.8 Flash TTS 与 Flash-Lite TTS,可用文字描述从零设计 AI 语音
Google 发布 Gemini 3.8 Flash TTS 和 Flash-Lite TTS 两款语音生成模型,支持 100 多种语言,Flash TTS 可通过文字描述从零设计语音,并支持 30 秒样本的声音克隆(需录制同意声明),生成内容带 SynthID 水印。
Hacker News:AI 热帖AI 评分6969 Google 发布 Gemini 3.8 Flash TTS 与 Flash-Lite TTS 语音生成模型
Google 发布 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款文本转语音模型,支持用自然语言提示词从零设计声音、30 秒音频样本复刻声音、逐行台词表演控制、原生双说话人场景编排,覆盖超过 100 种语言和方言。
Tibo@thsottiauxAI 评分7272
Elon Musk@elonmuskAI 评分5858IT之家(RSS)AI 评分6464 谷歌发布 Gemini 3.8 Flash TTS 与 Flash-Lite TTS 文本转语音模型
谷歌发布 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款文本转语音模型,支持逐行控制台词演绎、100 多种语言和 2000 多种现成语音。
Logan Kilpatrick@OfficialLoganKAI 评分6262Google DeepMind精选AI 评分6464 Gemini Live Avatar 上线企业入口,生成同步说话的视频形象
谷歌将实时视频形象加入 Gemini 3.8 Live,企业可构建带口型、表情和语音同步的对话角色,并在后台调用工具。服务支持多语言和预设形象;从参考图片定制形象需要企业白名单,音视频输出带有 SynthID 水印。
推荐理由:实时形象与工具调用结合,让企业对话界面可以表达表情和口型,公开的准入条件便于评估实际接入范围。
🚨 AI News | TestingCatalog@testingcatalogAI 评分5555Google DeepMind:Blog(RSS)精选AI 评分7474 Google DeepMind 发布 Gemini 3.8 Flash TTS 与 Flash-Lite TTS 语音生成模型
Google DeepMind 发布 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款文本转语音模型,支持用自然语言提示词从零设计声音、30 秒样本复刻声音,并提供逐行表演指导、长时音频生成和双说话人场景编排,覆盖 100 多种语言。
推荐理由:官方介绍了两款 TTS 模型的能力细节、评测名次和开放入口,开发者可以据此评估语音生成工作流的选型。
Artificial Analysis@ArtificialAnlysAI 评分5454Google 发布 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两个文生语音模型,支持预设音色和声音复刻。
Google AI@GoogleAIAI 评分6262Baseten 工程博客(网页)AI 评分5656 NVIDIA Nemotron 3 Diarization 上线 Baseten,实时说话人分离低至每音频小时一美分
Baseten 发布对 NVIDIA Nemotron 3 Diarization 的托管支持,这是一个约 100M 参数的流式说话人分离模型,单一 checkpoint 可在 0.32 到 30.4 秒间配置四种算法延迟。
Google DeepMind@GoogleDeepMindAI 评分5757Hugging Face:Blog(RSS)AI 评分5959 NVIDIA 发布开源 100M 参数说话人分离模型 Nemotron 3 Diarization,登顶 VoiceArena Diarization-Bench
NVIDIA 发布开源权重、100M 参数的 Nemotron 3 Diarization 说话人分离模型,支持最多八名说话人,在 VoiceArena Diarization-Bench 12 个系统中以 14.72% DER 排名第一,比第二名低约 24% 相对值。
The Decoder:AI News(RSS)AI 评分6868 阿里 Qwen 发布 Qwen-Audio-3.1 五款语音模型,语音价格最高下调 95%
阿里 Qwen 团队发布 Qwen-Audio-3.1,包含五款覆盖语音识别(ASR)、语音合成(TTS)和实时交互的模型。ASR 改进多语言和方言识别并自动清理填充词,ASR-Next 支持多说话人识别、时间戳及情绪和环境声检测;TTS-Next 将语言模型与扩散方法结合,可一次性生成语音、音效和背景音频。同步降价:TTS 约 70%,Realtime 约 85%,ASR 最高 95%。
Qwen@Alibaba_Qwen精选AI 评分6767推荐理由:官方一次性给出五个音频模型的能力细节和三档降价幅度,读者可对照自身场景评估替换成本。
IT之家(RSS)AI 评分5555 特斯拉北美车机上线 Grok Bot,可语音下单购物、管理日程
特斯拉在 X 平台官宣 Grok Bot 于北美车机上线,驾驶员可免手动查看邮件、管理日程、线上购物和梳理待办。功能通过唤醒口令、方向盘按键或应用启动器触发,访问 Gmail、Google Calendar 等第三方服务需配置连接器,目前仅对 SuperGrok Heavy 订阅用户开放,其他订阅档位后续获得资格,连接器则所有用户均可配置。
IT之家(RSS)AI 评分6868 阿里千问发布 Qwen-Audio-3.1 系列五款语音模型并全线降价
千问发布 Qwen-Audio-3.1 系列语音大模型,包含 ASR、ASR-Next、TTS、TTS-Next 和 Realtime 五款模型,覆盖语音识别、合成、实时交互和音频创作。
MarkTechPost(RSS)AI 评分6868 Kyutai 发布 Voice of Reason,用强化学习让语音原生模型解出口算数学题
Kyutai 发布 Voice of Reason,两个基于 GLM-4-Voice-9B 的开源权重语音到语音模型,无需转写和独立文本 LLM 即可口头解数学题。
Artificial Analysis@ArtificialAnlysAI 评分5252
Artificial Analysis@ArtificialAnlysAI 评分5353
Elon Musk@elonmuskAI 评分5151Elon Musk 宣布 Grok 已可用在 Tesla 中,可通过 Connectors 免手动完成收件箱管理、日历清理以及对话已有文件/聊天/任务等实际工作。
MarkTechPost(RSS)AI 评分5959 2026年7家语音克隆API横评:说话人相似度、同意校验与每1M字符价格
MarkTechPost用同一段10秒参考音频在ElevenLabs、Cartesia、Inworld、Gradium、Fish Audio、Resemble AI、Hume七家平台实测语音克隆,并从参考音频需求、同意验证、商业许可、语言数和每1M字符价格五个维度对比。
The Decoder:AI News(RSS)AI 评分6060 腾讯 Gander 模型实现边聊天边后台执行复杂任务
腾讯混元语音团队联合多所高校发布 Gander 模型,用"小脑"负责实时对话、可替换的"大脑"处理后台智能体任务(测试中用 GPT-5.6 家族模型),可同时处理语音、图像和文本并随时被打断。
MarkTechPost(RSS)AI 评分6363 阿里通义Qwen团队发布Qwen3.8-LiveTranslate,实时翻译平均延迟降至2.3秒、支持60种语言
通义千问(Qwen)发布实时同声传译模型Qwen3.8-LiveTranslate,采用新的Interleave架构,平均滞后(LAAL)从2.8秒降至2.3秒,约降低18%。
Rohan Paul@rohanpaul_aiAI 评分5252Rohan Paul 引用 Pocket FM 创始人 Rohan Nayak2 的介绍,认为衡量 AI 最有用的指标有时不是专家提速多少,而是有多少人能完成以前不敢尝试的工作流。
IT之家(RSS)AI 评分6060 SpaceXAI 发布 Grok Voice Transcribe 2.0 语音转文本模型,错误率降低约一半且价格不变
当地时间 9 月 18 日,SpaceXAI 发布 Grok Voice Transcribe 2.0 语音转文本模型,在价格不变的前提下错误率降低约一半。该模型基于 Grok Voice 底层音频基础模型构建,在 Artificial Analysis 全部 32 款流式模型中准确率居首;官方四个内部数据集评测均超越 1.0 版本。
Qwen@Alibaba_QwenAI 评分5757IT之家(RSS)AI 评分6363 Neuralink 演示脑机接口让失语志愿者以原声说出“我爱你”
Neuralink 于 9 月 18 日在 X 平台发布演示,有语言障碍的志愿者 Terry 植入脑机接口后,通过意念将其神经信号转化为与原声高度匹配的合成语音,传达“我爱你”。
IT之家(RSS)AI 评分6363 阿里千问发布同声传译大模型 Qwen3.8-LiveTranslate,支持原文译文同帧同出
阿里千问发布同声传译大模型 Qwen3.8-LiveTranslate,基于 Hybrid MoE 的 Thinker–Talker 双模块设计,以 Interleave 架构重构实时同传,字均延迟(LAAL)从 2.8 秒降至 2.3 秒。