跳到正文

#语音

今日 0 条
9月24日周四
  1. OpenAI72

    OpenAI 宣布 ChatGPT Voice 更新,即日起在最新版应用全球推送。语音功能现可使用邮件、日历和 Slack 等插件,并由 GPT-6 Astra、Sol 和 Luna 模型驱动。同时语音可在网页和移动端的 ChatGPT Work 中使用,仅通过说话即可在浏览器中创建文档、演示文稿、网站和表格,或处理复杂任务。

    推荐理由:官方宣布 ChatGPT Voice 接入插件和新模型并支持语音驱动工作流,读者可据此了解语音能力扩展到哪些日常任务。

  2. TechCrunch:AI(RSS)58

    OpenAI 在 ChatGPT 移动端推出语音触发的智能体功能

    OpenAI 宣布为 ChatGPT 移动端带来语音触发的智能体功能,用户可用语音让模型起草文档、总结邮件等。Plus 和 Pro 用户可在手机 Work 标签页创建文档、草拟邮件、总结 Slack 消息,还能建站、做演示文稿、使用云端浏览器和财务功能;Free 和 Go 用户可使用插件和已连接应用。

  3. Google DeepMind64

    Gemini Live Avatar 上线企业入口,生成同步说话的视频形象

    谷歌将实时视频形象加入 Gemini 3.8 Live,企业可构建带口型、表情和语音同步的对话角色,并在后台调用工具。服务支持多语言和预设形象;从参考图片定制形象需要企业白名单,音视频输出带有 SynthID 水印。

    推荐理由:实时形象与工具调用结合,让企业对话界面可以表达表情和口型,公开的准入条件便于评估实际接入范围。

9月23日周三
  1. Google DeepMind:Blog(RSS)74

    Google DeepMind 发布 Gemini 3.8 Flash TTS 与 Flash-Lite TTS 语音生成模型

    Google DeepMind 发布 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款文本转语音模型,支持用自然语言提示词从零设计声音、30 秒样本复刻声音,并提供逐行表演指导、长时音频生成和双说话人场景编排,覆盖 100 多种语言。

    推荐理由:官方介绍了两款 TTS 模型的能力细节、评测名次和开放入口,开发者可以据此评估语音生成工作流的选型。

  2. The Decoder:AI News(RSS)68

    阿里 Qwen 发布 Qwen-Audio-3.1 五款语音模型,语音价格最高下调 95%

    阿里 Qwen 团队发布 Qwen-Audio-3.1,包含五款覆盖语音识别(ASR)、语音合成(TTS)和实时交互的模型。ASR 改进多语言和方言识别并自动清理填充词,ASR-Next 支持多说话人识别、时间戳及情绪和环境声检测;TTS-Next 将语言模型与扩散方法结合,可一次性生成语音、音效和背景音频。同步降价:TTS 约 70%,Realtime 约 85%,ASR 最高 95%。

  3. Qwen67

    Qwen 发布 Qwen-Audio-3.1,ASR、TTS 与 Realtime 全面升级,并新增音频创作模型 TTS-Next 和音频理解模型 ASR-Next,共五个模型覆盖理解、生成、交互与创作。全线降价,TTS 约 70% off、Realtime 约 85% off、ASR 最高 95% off;Realtime 可边说边听、随时打断,检测到低落情绪时会放慢语速并共情回应。

    推荐理由:官方一次性给出五个音频模型的能力细节和三档降价幅度,读者可对照自身场景评估替换成本。

  4. IT之家(RSS)55

    特斯拉北美车机上线 Grok Bot,可语音下单购物、管理日程

    特斯拉在 X 平台官宣 Grok Bot 于北美车机上线,驾驶员可免手动查看邮件、管理日程、线上购物和梳理待办。功能通过唤醒口令、方向盘按键或应用启动器触发,访问 Gmail、Google Calendar 等第三方服务需配置连接器,目前仅对 SuperGrok Heavy 订阅用户开放,其他订阅档位后续获得资格,连接器则所有用户均可配置。

9月22日周二
9月21日周一
9月20日周日
9月19日周六