跳到正文

#语音

今日 0 条
9月3日周四
  1. IT之家(RSS)31

    阿里 Qoder 上线眼镜版,将接入千问和乐奇 AI 眼镜

    据阿里云消息,阿里智能体编程平台 Qoder 于 9 月 3 日上线 Qoder 眼镜版,首批接入千问 AI 眼镜和乐奇 AI 眼镜。眼镜版集成全双工语音方案,用户可通过语音交互让 Agent 执行任务、追问进展、追加要求;高风险操作与任务关键节点会以卡片形式推送到视野边角,可语音确认或轻触镜腿完成审批。

9月2日周三
  1. 🚨 AI News | TestingCatalog55

    Catch 发布 AI 行政助理 Catch AI,定位是为忙碌的高管真正执行行政工作,而非仅建议或总结。产品可管理日历、分类收件箱并代表用户拨打真实电话,支持连接 Slack、WhatsApp、iMessage、邮件和电话等渠道。示例包括直接邮件对方安排或改期会议、致电餐厅和诊所等、在用户确认意图后代拟发送邮件,以及语音播报当日安排并按回答执行。

  2. IT之家(RSS)28

    消息称腾讯开发全新 AI 输入法助手 ChatterFly,中文名或为元宝输入法

    据读佳消息,腾讯正在开发全新 AI 输入法助手 App ChatterFly,中文名可能叫元宝输入法,除移动端外或计划推出 Windows、macOS 桌面客户端。产品支持语音、拼音等输入模式,搭载文本润色、表达优化等生成式 AI 能力,依托腾讯混元大模型,并配有个人词库、语音记录、输入行为统计等功能。上线时间和具体功能仍以官方口径为准。

  3. HuggingFace Daily Papers(社区热门论文)38

    面向语音脑机接口的通用度量 OVMI

    论文提出开词表互信息 OVMI,一种信息论度量,用于在不同数据集、记录方式与词表条件下统一评估语音脑机接口解码器传达的信息量。作者指出通常报告的 accuracy、word error rate (WER) 等仅覆盖系统支持词表的指标会高估能力;用 OVMI 比较现有系统并优化词表选择,在三个语音域上取得最高 16.3% 的相对准确率提升。

  4. TechCrunch:AI(RSS)38

    Amazon Alexa 推出 Update Me When 主动提醒购物功能

    Amazon 于周二在 Alexa for Shopping AI 助手中推出新功能 Update Me When,可在可能引发购买的新动态发生时向用户发送个性化通知,例如关注品牌发布新产品线、喜欢的剧集更新、歌手宣布巡演或作者出新书。目前需用户自行配置提醒;同批还展示了价格追踪、个性化优惠、购物指南、手写清单转录等 AI 购物功能。

9月1日周二
  1. Meta 官方70

    Muse Voice Transcribe 发布,实时转写支持多说话人与语言切换

    Muse Voice Transcribe 提供流式语音识别、说话人区分和端点检测,已用于 Meta AI、Muse Code 并通过模型 API 提供。模型训练覆盖七十多种语言,其中二十五种经过深入验证;支持语言切换不代表所有语言质量完全相同。

    推荐理由:实时转写同时输出说话人和语言变化,为会议及编程助手保留对话结构,便于后续检索和任务处理。

8月27日周四
  1. Google DeepMind71

    Google 发布 Gemini 3.5 Transcribe 语音转文字模型

    Google 发布 Gemini 3.5 Transcribe,称其为目前最精确的语音转文字模型,可将原始音频直接转为准确、格式化文本。据 Artificial Analysis 测量,流式场景平均词错误率 4.0%,非流式 2.6%;相比上一代 Chirp 3,最终转写时间改善 70%,FLEURS 基准上流式 WER 为 5.50%、非流式为 5.04%。

    推荐理由:Gemini 3.5 Transcribe 的 WER、延迟与多语言数据,可用来判断实时语音转写当前的能力水位。

7月30日周四
6月9日周二
  1. Google DeepMind78

    Google DeepMind 发布 Gemini 3.5 Live Translate 实时语音翻译模型

    Google DeepMind 发布音频模型 Gemini 3.5 Live Translate,可自动检测 70+ 语言并生成保留说话人语调、节奏和音高的近实时语音翻译,全程仅落后说话人数秒。

    推荐理由:Gemini 3.5 Live Translate 支持 70+ 语言连续语音翻译,并同步开放 API、Meet 与 Translate 入口,可据此判断实时翻译的落地节奏。

4月30日周四
4月16日周四
  1. Google DeepMind71

    Google DeepMind 发布 Gemini 3.1 Flash TTS 语音模型

    Google DeepMind 发布 Gemini 3.1 Flash TTS 文本转语音模型,在 Artificial Analysis TTS 榜单上取得 1,211 Elo 分数,并支持 70 多种语言和原生多说话人对话。

    推荐理由:官方给出 Gemini 3.1 Flash TTS 的 Elo 分数、音频标签控制方式和多平台开放入口,可据此判断语音生成的可控性变化。