跳到正文

#语音

今日 0 条
10月6日周二
  1. The Verge · AI31

    Amazon Alexa Plus 被曝持续数分钟诡异重复「lalala」

    Amazon Echo 智能音箱上的 Alexa Plus 出现 bug,会连续数分钟只重复说唱「lalala」,有时还发生在与用户对话中途,被追问时 Alexa 似乎完全不知道自己在做什么。该问题近几周在 Reddit 上被多次报告,最近一次在三天前,涉及多种 Echo 音箱型号,并有用户上传视频。Amazon 已确认这是影响「少量 Alexa Plus 用户」的 bug,正在修复。

  2. The Verge · AI26

    Gemini Call for Me 或将支持给家人打电话留言

    Google 的 Gemini「Call for Me」AI 功能可能从商务通话扩展到个人通话,可代用户给亲友打电话传话,例如「打给妈妈说我晚到 15 分钟」。Android Authority 在 APK 拆包中发现「Gemini Calling」引导界面,并发现针对单个应用的细粒度权限设置,用户或可选择允许 Gemini 访问哪些应用能力。该扩展与细粒度权限设置是否公开发布尚不确定。

10月3日周六
  1. The Decoder58

    Suno 推出 Speech 功能,可生成语音与配套背景音乐

    AI 音乐生成器 Suno 新增 Speech 功能,可把口述文本与匹配的背景音乐合成为单条音轨,用户输入想法或文字并描述想要的音色与音乐风格即可生成。Suno 产品负责人 Jack Brody 称该功能已在小范围测试一个月,可用于诗歌、冥想和睡前故事,但测试版仍有 bug,例如英式口音有时会听起来像澳式口音。

10月2日周五
  1. The Verge · AI55

    Suno 上线语音生成功能,可同时生成人声与背景音乐

    AI 音乐生成平台 Suno 推出语音生成功能 Speech,目前已在网页端和移动端开放公测,可同时生成配音与背景音乐并合成为一条音轨。该功能提供 Simple 和 Advanced 两种模式,前者通过提示词描述生成内容,后者支持自定义脚本并调整 AI 声音性别、语音风格和生成多样性,最长时长约 8 分钟,背景音乐可用开关关闭。

  2. TechCrunch · AI58

    AI 语音初创公司 ElevenLabs 估值翻倍至 220 亿美元

    AI 语音初创公司 ElevenLabs 宣布允许员工以 220 亿美元估值出售部分已归属股权,较今年 2 月融资时的 110 亿美元估值翻倍。此次 3 亿美元的 tender offer 由 Wellington 和 T. Rowe Price 联合领投,是该公司第二次为员工安排股权转让,上一次为 2025 年 9 月按 66 亿美元估值进行的 1 亿美元 tender。

9月29日周二
9月28日周一
  1. 公众号:面壁智能(MiniCPM)38

    面壁智能亮相东盟博览会,发布多语种语音底座 VoxCPM

    2026年9月17日至21日,面壁智能在南宁举行的中国—东盟博览会上展示了其端侧高效大模型及针对东盟小语种的语音技术。联合创始人雷升涛阐述了“密度定律”推动端侧AI爆发,CTO曾国洋介绍了多语种语音底座VoxCPM。该模型基于2B参数架构,支持30种语言与9种方言,具备声音克隆、情感表达等能力,旨在解决东盟语言多样性挑战,并已在老挝国家大模型交付及多国政务、商业场景中落地。

  2. Dongxi 东锡 NLP45

    作者分享了一首完全由 Claude Opus 5.5 生成的歌曲。歌词和乐谱均由 Opus 5.5 通过 Python 代码生成,未使用 Suno 等专用 AI 音乐模型。人声部分利用 macOS 自带的 Siri 语音合成(Aaron 和 Nicky 音色),通过 Swift 程序逐音节朗读,再经信号处理转化为旋律。作者称此过程主要依靠频谱图分析而非人工听测,且大部分技术细节未显式提示给模型。

9月27日周日
  1. HuggingFace Daily Papers(社区热门论文)46

    重新思考自动语音相似度:从 EER 转向嵌入向量几何

    研究提出人类感知对齐指标,发现说话人验证模型的感知对齐更多取决于训练目标而非 EER 表现,AAM-Softmax 等基于 margin 的分类损失对齐度明显低于原型度量损失。团队将差异追溯到嵌入向量几何,有效维度 d_eff 与感知对齐的秩相关达 -0.95,施加维度瓶颈后 ρ_align 从 0.08 升至 0.74。

9月26日周六
9月25日周五
  1. The Decoder:AI News(RSS)52

    Google 测试 Call for Me 功能,Gemini 可代替用户致电商家

    Google 正在测试 Call for Me 功能,让 Gemini 代表用户致电商家处理订位、改约或查询库存等任务。目前仅限美国 Pixel 11 用户使用,需要付费 Gemini 订阅和 Phone 应用测试版;AI 会通过语音菜单、等待接听,并用用户自己的号码拨出,用户可通过实时转录查看通话并随时接管。

  2. HuggingFace Daily Papers(社区热门论文)51

    PUBG Ally:PUBG 中可语音对话的具身智能体队友

    论文介绍 PUBG Ally,一个在 PUBG: BATTLEGROUNDS 中作为语音队友的具身智能体,可感知动态游戏环境并自主行动。语言模型智能体通过受控接口检查游戏信息、理解玩家语音并下发高层动作,交给更快的控制层执行移动、战斗和恢复;团队基于近 39k 场真实玩家共玩对局的数据做迭代训练,并通过模型压缩、上下文压缩、安全训练和运行时护栏实现低延迟端侧部署与玩家沟通安全。

9月24日周四
  1. Latent Space67

    Meta Connect 2026:Muse 智能体、眼镜硬件与实时语音

    Meta 在 Connect 2026 上把 Muse 个人智能体作为硬件加智能体战略的核心,发布眼镜等新硬件并预告但未发布新前沿模型。Muse 新增语音与实时视频能力,可为每台 Muse 分配独立邮箱,Mac 版支持 computer use,连接器平台覆盖 1500+ 应用,Muse Realtime Avatar 以研究形式发布,输出带水印且响应低于一秒。

  2. IT之家(RSS)71

    OpenAI 为 ChatGPT 移动端新增语音智能体功能,可语音撰写文档、总结邮件

    OpenAI 宣布 ChatGPT 移动端新增基于语音的智能体功能,用户可通过说话完成撰写文档、总结电子邮件等工作。Pro 和 Plus 订阅用户可用"工作"创建文档、写邮件、总结 Slack 消息,还能创建网站、制作 PPT、使用云端浏览器;Free 和 Go 用户可使用插件和已连接的应用,Plus 用户可在文本和语音间切换,或从手机转到电脑继续。