跳到正文

#语音

今日 0 条
9月12日周六
9月11日周五
  1. IT之家(RSS)55

    小米开源工业级目标说话人语音识别大模型 Xiaomi-CocktailASR-1

    小米发布并开源工业级目标说话人语音识别大模型 Xiaomi-CocktailASR-1,针对多人同时说话时识别率大幅下降的鸡尾酒会难题。模型采用端到端 LLM 架构,以目标说话人参考音频作为声纹提示,在多个主流多说话人测试集上达到 SOTA;单人识别性能比肩标准 ASR 模型,可拒识非目标说话人并支持思维链推理模式。代码开源于 GitHub 和 HuggingFace。

  2. OpenAI:官网动态(RSS · 排除企业/客户案例)70

    OpenAI 在 API 中推出全双工语音模型 GPT-Live-1

    OpenAI 在 API 中发布语音模型 GPT-Live-1,可同时听和说,支持将推理和工具调用委派给 GPT-6 Astra 等后端模型,前端语音层定价为每分钟 $0.05。

    推荐理由:原文给出单模型全双工语音架构、基准变化和定价,读者可以据此评估它能否简化现有语音 Agent 的分层方案。

9月10日周四
9月9日周三
  1. HuggingFace Daily Papers(社区热门论文)57

    Gander 全双工全模态交互智能体技术报告发布并开源

    作者发布 Gander 技术报告,这是一个端到端模型,在单一框架内统一全模态感知、实时交互与智能体能力,支持视频、语音、文本流式输入与随时打断的全双工交互。其采用 Cerebellum-Brain 协同框架,小脑负责实时交互与对话,大脑负责复杂推理与智能体任务,并基于流式 Thinker-Talker 架构实现低延迟;模型、代码和数据将开源。

9月6日周日
9月5日周六
9月4日周五
  1. IT之家(RSS)57

    人人影视更名上线 App,李渊敏称力争激活 3000 万存量用户并优先面向东南亚输出国产影视

    人人影视更名为“人人影视分享精彩”,App 已在安卓端上线、iOS 端筹备完成,运营方为分享精彩网络科技(嘉兴)有限公司,负责人李渊敏称本月起点对点推广、力争激活 3000 万存量用户。平台依托 7 万余集影视素材样本打造 AI 影视本地化技术,实现角色音色克隆,计划覆盖 50 余个国家和地区,优先面向东南亚输出国产影视内容,片源与华数传媒合作正版购买,目前处于前期公测、月底正式发布。

  2. The Verge:AI(RSS)61

    Google 推出 Gmail Live、Docs Live 和 Keep Live 语音助手功能

    Google 开始向全球移动端推出 Gmail Live、Docs Live 和 Keep Live 三项 AI 语音功能,支持免手操作查询信息、总结和转录。Gmail Live 可从收件箱口头回答问题并附邮件来源链接,Docs Live 能把口述需求整理成结构化文档并可在授权后调用 Gmail、Drive、Chat 和网页信息,Keep Live 支持自然语言记录笔记。

9月3日周四
  1. Microsoft AI:官方博客(网页)64

    Microsoft AI 发布语音识别模型 MAI-Transcribe-2

    Microsoft AI 发布转录模型 MAI-Transcribe-2,称其在 FLEURS 基准 60 种语言上平均词错率 5.2% 排名第一,并占据 Artificial Analysis 准确率-延迟 Pareto 前沿。

    推荐理由:官方给出具体基准排名、对比速度倍数和定价,读者可以据此评估它对现有语音转写方案的可替换性。