阿里 Qoder 上线眼镜版,将接入千问和乐奇 AI 眼镜
据阿里云消息,阿里智能体编程平台 Qoder 于 9 月 3 日上线 Qoder 眼镜版,首批接入千问 AI 眼镜和乐奇 AI 眼镜。眼镜版集成全双工语音方案,用户可通过语音交互让 Agent 执行任务、追问进展、追加要求;高风险操作与任务关键节点会以卡片形式推送到视野边角,可语音确认或轻触镜腿完成审批。
据阿里云消息,阿里智能体编程平台 Qoder 于 9 月 3 日上线 Qoder 眼镜版,首批接入千问 AI 眼镜和乐奇 AI 眼镜。眼镜版集成全双工语音方案,用户可通过语音交互让 Agent 执行任务、追问进展、追加要求;高风险操作与任务关键节点会以卡片形式推送到视野边角,可语音确认或轻触镜腿完成审批。
Microsoft Research 发布 VibeVoice-ASR-Streaming 技术报告,提出基于 LLM 的端到端流式说话人归属 ASR,将音频块、0.5 秒 lookahead 和已有文本交错在单一自回归上下文中,无需独立 diarization 阶段即可随语音到达输出谁说了什么。
Sierra 发布企业级语音 AI 指南,讲解企业语音 AI 的工作原理,并提出七项通话就绪测试。测试覆盖听觉、延迟、动作、护栏与人工转接五个维度,用于评估 AI 语音智能体。
据读佳消息,腾讯正在开发全新 AI 输入法助手 App ChatterFly,中文名可能叫元宝输入法,除移动端外或计划推出 Windows、macOS 桌面客户端。产品支持语音、拼音等输入模式,搭载文本润色、表达优化等生成式 AI 能力,依托腾讯混元大模型,并配有个人词库、语音记录、输入行为统计等功能。上线时间和具体功能仍以官方口径为准。
Meta Superintelligence Labs 发布首个实时音频感知模型 Muse Voice Transcribe,将流式 ASR、20+ 说话人的说话人分离和端点检测合并为一个自回归模型,无需后处理。
Grok 在语音对话模式中上线屏幕共享功能,用户可将浏览器中的画面共享给语音模型,由其实时看到屏幕内容并逐步讲解指引。引用用户反馈称该功能运行效果很好。
Meta 推出首个实时音频感知模型 Muse Voice Transcribe,整合流式语音识别、说话人分离与端点检测,可通过 Meta Model API 调用,定价每 1000 分钟音频 3 美元。
论文提出开词表互信息 OVMI,一种信息论度量,用于在不同数据集、记录方式与词表条件下统一评估语音脑机接口解码器传达的信息量。作者指出通常报告的 accuracy、word error rate (WER) 等仅覆盖系统支持词表的指标会高估能力;用 OVMI 比较现有系统并优化词表选择,在三个语音域上取得最高 16.3% 的相对准确率提升。
论文提出 Temporal Context Routing(TCR),将结构化剧本中的镜头切换和对白时间映射到音视频生成的共享时间轴,并把各提示词引导路由到两种模态的对应位置。
Google 发布八月 AI 更新汇总:推出面向编码和 Agent 的工作模型 Gemini 3.7 Flash,价格为 Gemini 3.6 Flash 推出价的一半每百万 token。
Amazon 于周二在 Alexa for Shopping AI 助手中推出新功能 Update Me When,可在可能引发购买的新动态发生时向用户发送个性化通知,例如关注品牌发布新产品线、喜欢的剧集更新、歌手宣布巡演或作者出新书。目前需用户自行配置提醒;同批还展示了价格追踪、个性化优惠、购物指南、手写清单转录等 AI 购物功能。
Sonos于9月1日发布Beam Ultra回音壁、Ace Ultra头戴式耳机及音频操作系统Sonos 27。Sonos 27包含自研语音助手Sonos 27voice(今年秋季抢先体验)和可接入ChatGPT、谷歌Gemini的Sonos 27mcp(9月8日开放),未来还将支持最多创建10个自定义AI智能体(2027年提供)。
Eric Zakariasson 汇总用户对 grok @bot 的改进反馈,公布十大方向:提高用量上限、减缓 token 消耗、增加第一方 connectors 并修复不稳定项。
Meta 似乎正在向欧盟更多用户推送 Meta AI 应用的语音模式。界面同时提供升级到 Meta One Core 和 Premium 订阅方案的入口;作者称感觉大多数用户此前已能用上该功能。
深圳 AI 纪要硬件企业机智连接(Plaud)上周宣布推出 AI 纪要 TWS 耳机 Plaud One,内置 4G LTE eSIM,定价 249.99 美元(约合 1,684 元人民币),限量 2000 台。
DreamX-Creator 1.0 是一个以 7B 生成器为核心的原生音视频联合生成系统,基于首帧和文本提示对音频与视频流联合去噪,通过 Gated Cross-Modal Attention 在网络后半段耦合两个模态。
Gradium AI 于 2026 年 8 月 31 日发布新 TTS 模型并设为 API 和 Studio 的默认选项,无需迁移,现有声音包括自定义克隆继续可用。
Muse Voice Transcribe 提供流式语音识别、说话人区分和端点检测,已用于 Meta AI、Muse Code 并通过模型 API 提供。模型训练覆盖七十多种语言,其中二十五种经过深入验证;支持语言切换不代表所有语言质量完全相同。
推荐理由:实时转写同时输出说话人和语言变化,为会议及编程助手保留对话结构,便于后续检索和任务处理。
Google 发布 Gemini 3.5 Transcribe,称其为目前最精确的语音转文字模型,可将原始音频直接转为准确、格式化文本。据 Artificial Analysis 测量,流式场景平均词错误率 4.0%,非流式 2.6%;相比上一代 Chirp 3,最终转写时间改善 70%,FLEURS 基准上流式 WER 为 5.50%、非流式为 5.04%。
推荐理由:Gemini 3.5 Transcribe 的 WER、延迟与多语言数据,可用来判断实时语音转写当前的能力水位。
Google DeepMind 发布音乐生成模型 Lyria 3.5,并当天在 Google Flow Music 上线。新版本在旋律结构、歌词质量与提示词遵循、人声表现力与发音上均有提升,同时让用户更易控制输出的节奏与时长。
Google DeepMind 发布音频模型 Gemini 3.5 Live Translate,可自动检测 70+ 语言并生成保留说话人语调、节奏和音高的近实时语音翻译,全程仅落后说话人数秒。
推荐理由:Gemini 3.5 Live Translate 支持 70+ 语言连续语音翻译,并同步开放 API、Meet 与 Translate 入口,可据此判断实时翻译的落地节奏。
Google DeepMind 宣布 AI co-clinician 研究计划,探索 AI 智能体在医生临床监督下协助患者诊疗。
推荐理由:Google DeepMind 公开 AI co-clinician 研究,给出医生盲评与实时多模态模拟的对比结果,可了解医疗智能体当前的能力边界。
Google DeepMind 发布 Gemini 3.1 Flash TTS 文本转语音模型,在 Artificial Analysis TTS 榜单上取得 1,211 Elo 分数,并支持 70 多种语言和原生多说话人对话。
推荐理由:官方给出 Gemini 3.1 Flash TTS 的 Elo 分数、音频标签控制方式和多平台开放入口,可据此判断语音生成的可控性变化。