跳到正文

#语音

今日 0 条
9月19日周六
  1. xAI:News(网页)64

    xAI 发布 Grok Voice Transcribe 2.0 语音转写模型,准确率较 1.0 翻倍

    xAI 发布 Grok Voice Transcribe 2.0 语音转写模型,官方称在真实场景评测中准确率是 1.0 的两倍且价格不变。在 Artificial Analysis 公开榜单上,它在 32 个 streaming 模型中准确率排名第一;多语言能力提升最大,短短语集合上词错误率从 20.6% 降至 6.8%。

    推荐理由:原文给出公开榜单排名、内部错误率数字和与 1.0 同价的定价,读者可据此评估迁移成本与实际收益。

9月18日周五
  1. Qwen:Blog Retrieval(API)69

    Qwen 发布 Qwen3.8-LiveTranslate 实时同传模型,LAAL 降至 2.3 秒

    Qwen 发布 Qwen3.8-LiveTranslate,采用 Interleave 架构与 Hybrid-MoE Thinker–Talker 设计重构实时同声传译,平均滞后(LAAL)从上一代的 2.8 秒降至 2.3 秒。

    推荐理由:官方给出了架构设计、LAAL 从 2.8 秒到 2.3 秒的数字和多语言评测结果,读者可以据此评估其实时翻译能力的实际变化。

  2. Qwen:Blog Retrieval(API)78

    Qwen 发布原生全模态模型 Qwen3.8-Omni-Flash,主打音视频智能体任务交付

    Qwen 发布下一代原生全模态模型 Qwen3.8-Omni-Flash,支持文本、图像、音频和视频输入及 1M token 上下文窗口,29 项评测平均分较 Qwen3.5-Omni-Plus 提升超过 25%,音频输入每小时价格下降超过 98%,音视频输入每小时价格下降超过 93%。

    推荐理由:官方发布同时开放 API 和开源插件与运行时,读者可以据此评估音视频智能体在剪辑、会议、实时交互等工作流中的落地方式。

9月17日周四
9月16日周三
  1. 蚂蚁 inclusionAI:GitHub 新仓库63

    蚂蚁 inclusionAI 开源 Realtime-Venus 全双工交互系统

    蚂蚁集团 Venus 团队与清华大学在 GitHub 开源 Realtime-Venus,一个支持全双工对话与异步任务委托的实时交互系统。系统包含三个组件:Realtime-Venus-Omni(9B,流式音视频对话与主动交互)、Realtime-Venus-Audio(9B,语音交互与音频理解)以及负责后台任务执行并将结果返回同一对话的 Harness 运行时。

    推荐理由:蚂蚁和清华开源了全双工对话加异步委托任务的系统,含 9B 的 Omni 与 Audio 两个模型和 Harness 运行时,可直接下载推理或跑浏览器 demo。

  2. IT之家(RSS)54

    努比亚 NaviX Ultra 发布:主打 AI 智能体能力,5999 元起

    努比亚发布 NaviX Ultra 手机,宣称是首款 AI 智能体手机,售价 5999 元起,国补后 5499 元起。该机由豆包手机助手主导 AI 体验,搭载 Seed 全双工语音大模型和第五代骁龙 8 至尊版,支持一句话跨应用执行任务,端到端任务成功率超 80%,AI 唤醒率优于竞品 48%,并完成智能体大模型备案。

9月15日周二
9月14日周一
  1. IT之家(RSS)55

    豆包手机助手消费者版发布:推出 SAEP 协议,三方 App 可允许或拒绝 AI 自动化操作

    豆包手机助手消费者版 9 月 14 日正式发布,主打稳定性与交互体验,支持 AI 键(带指纹鉴权)、语音唤醒、屏幕问答、本地数据搜索和接入飞书妙记的录音体验。Beta 形式开放操作手机功能,并推出屏幕自动化操作声明协议 SAEP,第三方应用可声明允许或拒绝 AI 自动化操作,同步启动 30 天规则公示。首个消费者版将搭载于努比亚 NaviX Ultra,9 月 16 日发售。

9月13日周日
  1. Suno:Blog(网页)68

    Suno 发布 v6 音乐模型,推出 v6、v6-wild、v6-mini 三个版本

    Suno 发布新一代音乐模型 v6,与 Warner Music Group、BMG、Believe 等行业伙伴合作开发,后续将全面替换旧模型。v6 分为三个版本:旗舰 v6 和探索向的 v6-wild 面向 Pro 与 Premier 订阅用户,更快的 v6-mini 向所有人开放。

    推荐理由:官方发布新一代音乐模型,给出三个版本的定位差异和编辑、混音、采样等具体新能力,可帮助创作者判断如何选择和使用。

9月12日周六