用 Amazon Bedrock AgentCore、托管知识库和 Nova Sonic 构建语音旅行助手
基于 Amazon Bedrock AgentCore、Amazon Bedrock Knowledge Bases 和 Amazon Nova 2.5 Sonic,可在航空公司应用中搭建语音旅行助手,让旅客通过语音查询行程、改座位、更新餐食偏好并转接人工客服。
基于 Amazon Bedrock AgentCore、Amazon Bedrock Knowledge Bases 和 Amazon Nova 2.5 Sonic,可在航空公司应用中搭建语音旅行助手,让旅客通过语音查询行程、改座位、更新餐食偏好并转接人工客服。
Amazon Echo 智能音箱上的 Alexa Plus 出现 bug,会连续数分钟只重复说唱「lalala」,有时还发生在与用户对话中途,被追问时 Alexa 似乎完全不知道自己在做什么。该问题近几周在 Reddit 上被多次报告,最近一次在三天前,涉及多种 Echo 音箱型号,并有用户上传视频。Amazon 已确认这是影响「少量 Alexa Plus 用户」的 bug,正在修复。
Google 的 Gemini「Call for Me」AI 功能可能从商务通话扩展到个人通话,可代用户给亲友打电话传话,例如「打给妈妈说我晚到 15 分钟」。Android Authority 在 APK 拆包中发现「Gemini Calling」引导界面,并发现针对单个应用的细粒度权限设置,用户或可选择允许 Gemini 访问哪些应用能力。该扩展与细粒度权限设置是否公开发布尚不确定。
Napster 联合创始人 Sean Parker 正把 Stability AI 重塑为面向音乐从业者的 AI 工具公司。两年前他参与了 Stability AI 的 8000 万美元救助,如今与出任 CEO 的 Prem Akkaraju 一同公布新方向。
AI 音乐生成器 Suno 新增 Speech 功能,可把口述文本与匹配的背景音乐合成为单条音轨,用户输入想法或文字并描述想要的音色与音乐风格即可生成。Suno 产品负责人 Jack Brody 称该功能已在小范围测试一个月,可用于诗歌、冥想和睡前故事,但测试版仍有 bug,例如英式口音有时会听起来像澳式口音。
AI 音乐生成平台 Suno 推出语音生成功能 Speech,目前已在网页端和移动端开放公测,可同时生成配音与背景音乐并合成为一条音轨。该功能提供 Simple 和 Advanced 两种模式,前者通过提示词描述生成内容,后者支持自定义脚本并调整 AI 声音性别、语音风格和生成多样性,最长时长约 8 分钟,背景音乐可用开关关闭。
微软 AI 发布实时转写模型 MAI-Transcribe-2-Streaming,称其在 Artificial Analysis 准确率排名第一,支持 60 种语言,首个部分结果延迟略超 100 毫秒,年底前音频价格为每小时 0.54 美元。
Tavus 推出名为 Griffin 的 Human Interaction Model,可在实时视频通话中同时接收和生成语音、面部表情、语气、手势与停顿。
AI 语音初创公司 ElevenLabs 宣布允许员工以 220 亿美元估值出售部分已归属股权,较今年 2 月融资时的 110 亿美元估值翻倍。此次 3 亿美元的 tender offer 由 Wellington 和 T. Rowe Price 联合领投,是该公司第二次为员工安排股权转让,上一次为 2025 年 9 月按 66 亿美元估值进行的 1 亿美元 tender。
ElevenLabs 发布 Eleven v4 语音模型,更准确地跟随情感、停顿等方向提示,支持超过 90 种语言(v3 约为 70 种),单次可处理 10,000 字符,发音基准得分从 v3 的 85.6% 升至 91.7%。
MiniCPM-o 4.5 现已支持 SGLang Omni v0.1.7。 为开发者提供更多灵活运行和构建该模型的方式。
阿里 Qwen 团队发布 Qwen-Audio-3.1 系列 5 个音频模型,主力为面向语音智能体的全双工模型 qwen-audio-3.1-realtime-plus,通过 QwenCloud API 以 WebSocket 提供,未开源权重,并对 Realtime、TTS、ASR 分别降价约 85%、70% 和最高 95%。
科技媒体 WinFuture 曝光 2026 款亚马逊 Fire TV Stick 4K 宣传图,新品舍弃前代圆润曲线,改为更方正紧凑的盒状造型,仍直插电视 HDMI 端口,体积较前代略有缩小。
腾讯正在秘密内测 AI 游戏陪伴产品“鹅次元”,主打数字人 AI 搭子,提供语音对话、画面实时识别和游戏陪伴能力,内置多位人设各异的男女虚拟角色,选定后可闲聊或开启游戏陪伴模式,适配多款主流网游。该产品全部功能限时免费,界面已露出星币兑换能量的付费框架。
ElevenLabs 于当地时间周一发布 v4 与 v4 Turbo 两款语音模型,强化情绪表达控制、降低响应延迟,语言支持从 70 种提升至 90 余种,用户仅需 10 秒音频素材即可完成声音克隆。
ElevenLabs v4 现已登陆 Runway。v4 模型擅长旁白和角色对话,表现力和语调自然度均超越以往。 即日起可用,与全球顶尖的图像和视频模型一同提供。点击下方链接立即体验。
AWS 发布教程,演示如何用 vLLM-Omni Deep Learning Container 在 Amazon SageMaker AI 上部署 Qwen3-TTS 文本转语音模型,实现边生成边播放的流式语音输出。
Tarini Padmanabhuni 因祖父被 AI 深度伪造语音冒充其兄弟骗走赎金,创办旧金山公司 DetectifAI,做可在手机操作系统内本地运行的紧凑 AI 模型,在通话和语音消息中即时判断声音是否为 AI 生成,音频不出设备。
波士顿语音智能初创公司 Modulate 完成 2500 万美元新融资,由 Future Ventures 领投,Hyperplane 和 Lakestar 参投。
2026年9月17日至21日,面壁智能在南宁举行的中国—东盟博览会上展示了其端侧高效大模型及针对东盟小语种的语音技术。联合创始人雷升涛阐述了“密度定律”推动端侧AI爆发,CTO曾国洋介绍了多语种语音底座VoxCPM。该模型基于2B参数架构,支持30种语言与9种方言,具备声音克隆、情感表达等能力,旨在解决东盟语言多样性挑战,并已在老挝国家大模型交付及多国政务、商业场景中落地。
Nvidia 发布约 100M 参数的 Nemotron 3 Diarization 模型,权重免费开放,可实时区分最多八位说话人并检测重叠语音,支持录音和实时音频。
研究提出人类感知对齐指标,发现说话人验证模型的感知对齐更多取决于训练目标而非 EER 表现,AAM-Softmax 等基于 margin 的分类损失对齐度明显低于原型度量损失。团队将差异追溯到嵌入向量几何,有效维度 d_eff 与感知对齐的秩相关达 -0.95,施加维度瓶颈后 ρ_align 从 0.08 升至 0.74。
Pruned CTC 将 CTC 对齐计算限制在目标 token 与 blank 构成的小子集内,同时保留全词表归一化,并证明其损失与梯度同全词表 CTC 完全等价。
在 Caleb Flynn 被控杀害妻子的庭审中,检方播放了这名前 American Idol 选手用 AI 为情人生成的两个版本情歌。取证人员 Joseph Wilhelm 作证称,使用 GrayKey 的 Magnet 工具对 Flynn 的 iPhone 进行完整文件系统提取后,发现了 AI 音频文件和 Notes 应用中的歌词。
Google 正在测试 Call for Me 功能,让 Gemini 代表用户致电商家处理订位、改约或查询库存等任务。目前仅限美国 Pixel 11 用户使用,需要付费 Gemini 订阅和 Phone 应用测试版;AI 会通过语音菜单、等待接听,并用用户自己的号码拨出,用户可通过实时转录查看通话并随时接管。
论文介绍 PUBG Ally,一个在 PUBG: BATTLEGROUNDS 中作为语音队友的具身智能体,可感知动态游戏环境并自主行动。语言模型智能体通过受控接口检查游戏信息、理解玩家语音并下发高层动作,交给更快的控制层执行移动、战斗和恢复;团队基于近 39k 场真实玩家共玩对局的数据做迭代训练,并通过模型压缩、上下文压缩、安全训练和运行时护栏实现低延迟端侧部署与玩家沟通安全。
Duplex-MPE 基准发布,用于评估全双工语音助手在多人共享对话中何时应答、保持沉默或停止说话,包含 2000 个由三到四名人类说话者与一名助手构成的场景,同一请求分显式与隐式指代配对。
TechCrunch 刊发对 ElevenLabs 联合创始人兼 CEO Mati Staniszewski 的访谈,公司年经常性收入达 6 亿美元,55% 以上来自企业客户,据报道称投资人估值 220 亿美元。
Google 发布 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款语音生成模型,前者面向游戏、互动娱乐和长篇旁白,后者面向自动配音、对话智能体和高吞吐翻译流水线。
Meta 在 Connect 2026 上把 Muse 个人智能体作为硬件加智能体战略的核心,发布眼镜等新硬件并预告但未发布新前沿模型。Muse 新增语音与实时视频能力,可为每台 Muse 分配独立邮箱,Mac 版支持 computer use,连接器平台覆盖 1500+ 应用,Muse Realtime Avatar 以研究形式发布,输出带水印且响应低于一秒。
OpenAI 宣布 ChatGPT 移动端新增基于语音的智能体功能,用户可通过说话完成撰写文档、总结电子邮件等工作。Pro 和 Plus 订阅用户可用"工作"创建文档、写邮件、总结 Slack 消息,还能创建网站、制作 PPT、使用云端浏览器;Free 和 Go 用户可使用插件和已连接的应用,Plus 用户可在文本和语音间切换,或从手机转到电脑继续。