重新思考自动语音相似度:从 EER 转向嵌入向量几何
研究提出人类感知对齐指标,发现说话人验证模型的感知对齐更多取决于训练目标而非 EER 表现,AAM-Softmax 等基于 margin 的分类损失对齐度明显低于原型度量损失。团队将差异追溯到嵌入向量几何,有效维度 d_eff 与感知对齐的秩相关达 -0.95,施加维度瓶颈后 ρ_align 从 0.08 升至 0.74。
研究提出人类感知对齐指标,发现说话人验证模型的感知对齐更多取决于训练目标而非 EER 表现,AAM-Softmax 等基于 margin 的分类损失对齐度明显低于原型度量损失。团队将差异追溯到嵌入向量几何,有效维度 d_eff 与感知对齐的秩相关达 -0.95,施加维度瓶颈后 ρ_align 从 0.08 升至 0.74。
Pruned CTC 将 CTC 对齐计算限制在目标 token 与 blank 构成的小子集内,同时保留全词表归一化,并证明其损失与梯度同全词表 CTC 完全等价。
论文介绍 PUBG Ally,一个在 PUBG: BATTLEGROUNDS 中作为语音队友的具身智能体,可感知动态游戏环境并自主行动。语言模型智能体通过受控接口检查游戏信息、理解玩家语音并下发高层动作,交给更快的控制层执行移动、战斗和恢复;团队基于近 39k 场真实玩家共玩对局的数据做迭代训练,并通过模型压缩、上下文压缩、安全训练和运行时护栏实现低延迟端侧部署与玩家沟通安全。
Duplex-MPE 基准发布,用于评估全双工语音助手在多人共享对话中何时应答、保持沉默或停止说话,包含 2000 个由三到四名人类说话者与一名助手构成的场景,同一请求分显式与隐式指代配对。
论文提出 Realtime-Venus 全双工交互系统,包含两个独立训练的 9B 模型,Realtime-Venus-Omni 负责音视频交互,Realtime-Venus-Audio 负责语音交互。
作者发布 Gander 技术报告,这是一个端到端模型,在单一框架内统一全模态感知、实时交互与智能体能力,支持视频、语音、文本流式输入与随时打断的全双工交互。其采用 Cerebellum-Brain 协同框架,小脑负责实时交互与对话,大脑负责复杂推理与智能体任务,并基于流式 Thinker-Talker 架构实现低延迟;模型、代码和数据将开源。
Microsoft Research 发布 VibeVoice-ASR-Streaming 技术报告,提出基于 LLM 的端到端流式说话人归属 ASR,将音频块、0.5 秒 lookahead 和已有文本交错在单一自回归上下文中,无需独立 diarization 阶段即可随语音到达输出谁说了什么。
论文提出开词表互信息 OVMI,一种信息论度量,用于在不同数据集、记录方式与词表条件下统一评估语音脑机接口解码器传达的信息量。作者指出通常报告的 accuracy、word error rate (WER) 等仅覆盖系统支持词表的指标会高估能力;用 OVMI 比较现有系统并优化词表选择,在三个语音域上取得最高 16.3% 的相对准确率提升。
论文提出 Temporal Context Routing(TCR),将结构化剧本中的镜头切换和对白时间映射到音视频生成的共享时间轴,并把各提示词引导路由到两种模态的对应位置。
DreamX-Creator 1.0 是一个以 7B 生成器为核心的原生音视频联合生成系统,基于首帧和文本提示对音频与视频流联合去噪,通过 Gated Cross-Modal Attention 在网络后半段耦合两个模态。
Google DeepMind 宣布 AI co-clinician 研究计划,探索 AI 智能体在医生临床监督下协助患者诊疗。
推荐理由:Google DeepMind 公开 AI co-clinician 研究,给出医生盲评与实时多模态模拟的对比结果,可了解医疗智能体当前的能力边界。