OpenAI 在 ChatGPT 移动端推出语音触发的智能体功能
OpenAI 宣布为 ChatGPT 移动端带来语音触发的智能体功能,用户可用语音让模型起草文档、总结邮件等。Plus 和 Pro 用户可在手机 Work 标签页创建文档、草拟邮件、总结 Slack 消息,还能建站、做演示文稿、使用云端浏览器和财务功能;Free 和 Go 用户可使用插件和已连接应用。
OpenAI 宣布为 ChatGPT 移动端带来语音触发的智能体功能,用户可用语音让模型起草文档、总结邮件等。Plus 和 Pro 用户可在手机 Work 标签页创建文档、草拟邮件、总结 Slack 消息,还能建站、做演示文稿、使用云端浏览器和财务功能;Free 和 Go 用户可使用插件和已连接应用。
Google 发布 Gemini 3.8 Flash TTS 和 Flash-Lite TTS 两款语音生成模型,支持 100 多种语言,Flash TTS 可通过文字描述从零设计语音,并支持 30 秒样本的声音克隆(需录制同意声明),生成内容带 SynthID 水印。
Google 宣布 Antigravity SDK 支持本地工作流,首发支持通过 Google AI Edge 的 LiteRT 运行 Gemma 4 26B A4B,可完全离线获得智能体辅助能力,建议机器配备超过 24GB VRAM 或统一内存。
推荐理由:官方给出完整的本地模型接入步骤和混合编排示例,开发者可以直接照此把智能体工作流搬到离线环境。
YouTube 向创作者推出多项 AI 工具。YouTube Studio 内的故事助手可分析脚本和粗剪,给出节奏、结构与叙事建议,支持最多三个剪辑版本 A/B 测试;动态缩略图会为不同观众自动展示三张预览图中最合适的一张。
Google DeepMind 宣布将为 Private AI Compute 平台引入私密的服务端持久记忆,使 AI 助手能跨设备长期保留上下文。数据密封在云端专用加密存储中,解密密钥仅保存在用户设备上,请求通过端到端加密通道在隔离的安全飞区中临时解密处理,即使 Google 也无法访问。
谷歌将实时视频形象加入 Gemini 3.8 Live,企业可构建带口型、表情和语音同步的对话角色,并在后台调用工具。服务支持多语言和预设形象;从参考图片定制形象需要企业白名单,音视频输出带有 SynthID 水印。
推荐理由:实时形象与工具调用结合,让企业对话界面可以表达表情和口型,公开的准入条件便于评估实际接入范围。
vLLM 官方发布 vllm-metal v0.28.0,把 vLLM 的 V1 调度器、paged KV cache 和 OpenAI 兼容服务器带到 Apple Silicon,由 MLX 和 Metal 执行模型,版本号与上游 vLLM 对齐。
推荐理由:官方首次发布 vllm-metal,用 packed varlen attention 和 paged KV 解决 Mac 上并发请求的服务问题,并给出可复现的并发基准数据。
Baseten 发布对 NVIDIA Nemotron 3 Diarization 的托管支持,这是一个约 100M 参数的流式说话人分离模型,单一 checkpoint 可在 0.32 到 30.4 秒间配置四种算法延迟。
YouTube 在 9 月 23 日的年度创作者活动 Made on YouTube 上宣布升级 2025 年推出的 AI 创作工具,推出一款帮助创作者在后台优化频道的智能体。
YouTube 在年度 Made on YouTube 活动上宣布升级其 AI 创作者工具套件,引入一个在后台优化频道的 AI 智能体,可监测旧视频的新热度并建议修改缩略图和标题,还能整理频道受众数据生成品牌提案。
YouTube 在年度 Made on YouTube 活动上宣布为 YouTube Studio 推出多项 AI 功能。包括将 AI 问答功能 Ask Studio 扩展到 iOS 和 Android、对未发布视频草稿提供节奏和叙事建议、按视频内容生成匹配创作者风格的缩略图和标题、以及可向不同受众群体展示三种选项的动态缩略图。
YouTube 宣布推出名为 custom feeds 的新功能,用户可在提示词框中用自然语言描述想看的视频类型,由 Gemini 生成定制推荐流并置顶在首页独立标签中。
NVIDIA 发布开源权重、100M 参数的 Nemotron 3 Diarization 说话人分离模型,支持最多八名说话人,在 VoiceArena Diarization-Bench 12 个系统中以 14.72% DER 排名第一,比第二名低约 24% 相对值。
作者实测发现 Claude Code 2.1.277 宣布的 AGENTS.md 支持受名为 tengu_agents_md_mod 的远程 feature flag 控制。
阿里 Qwen 团队发布 Qwen-Audio-3.1,包含五款覆盖语音识别(ASR)、语音合成(TTS)和实时交互的模型。ASR 改进多语言和方言识别并自动清理填充词,ASR-Next 支持多说话人识别、时间戳及情绪和环境声检测;TTS-Next 将语言模型与扩散方法结合,可一次性生成语音、音效和背景音频。同步降价:TTS 约 70%,Realtime 约 85%,ASR 最高 95%。
亚马逊宣布扩大智能眼镜应用范围,将导航和送货指引直接呈现给配送司机,计划今年部署 5000 台,2027 年底投入使用设备超过 2 万台。眼镜结合人工智能、计算机视觉和摄像头,提供步行路线、识别危险、辅助查找包裹和记录送达;过去 18 个月已有超过 500 名配送人员试用,完成超过 27.5 万次配送。配套可穿戴控制器设有紧急按钮,电池可更换,支持处方镜片和变色镜片。
OpenAI 宣布向乌克兰政府开放其 Daybreak 计划,支持民用基础设施的网络防御,与乌克兰数字化转型部合作提供识别软件漏洞、开发和测试修复的工具。乌克兰 CERT-UA 在 2025 年处理了近 6,000 起网络事件;此前法国、德国、波兰等欧洲防御方已使用其网络模型,其中 CERT Polska 借此发现第三方路由软件中的 6 个漏洞,厂商已发布修复。
推荐理由:原文给出 Daybreak 计划向乌克兰开放的具体安排和 CERT-UA、CERT Polska 的使用案例,读者可借此了解 AI 网络防御工具的实际落地。
Qwen 发布 Qwen Intelligence,推出三款移动端智能体:Mobile Planner Agent 规划与编排复杂任务,在 MobilePA-Bench。
微软为 Windows 11 内置视频编辑器 Clipchamp 新增视频超分辨率功能,可利用本地算力将低分辨率视频提升至最高 4K。支持硬件包括 CPU,Copilot+ PC 可用 NPU,兼容 AMD、英特尔和高通硬件,仅限 Windows 桌面版,浏览器版暂不支持。微软提醒 AI 生成的细节可能出现伪影或失真,不建议用于法律证据、身份验证和医学影像等敏感场景。
特斯拉在 X 平台官宣 Grok Bot 于北美车机上线,驾驶员可免手动查看邮件、管理日程、线上购物和梳理待办。功能通过唤醒口令、方向盘按键或应用启动器触发,访问 Gmail、Google Calendar 等第三方服务需配置连接器,目前仅对 SuperGrok Heavy 订阅用户开放,其他订阅档位后续获得资格,连接器则所有用户均可配置。
ChatGPT Ads 宣布扩展至东南亚和台湾,使符合条件的商家可在超过 60 个国家和地区触达用户。
汽车过去只是把你送到公司。现在它能在路上帮你做一部分工作。 现在你可以在特斯拉里使用 Grok Bot 和 Connectors。
Discord 本周起根据账号存在时长、加入的服务器和活跃度等信号自动划分年龄组,超过 90% 的用户不会被要求确认年龄,模型不读取消息或通话内容。18 岁以上用户体验不变,13-17 岁青少年账户将获得额外保护,包括屏蔽年龄限制内容和陌生人消息审查。
Unreal Labs 发布 Unreal Agent,用完全异步的方式管理工具调用,免除模型处理等待、轮询和心跳的开销,官方称在真实工作负载和智能体基准上比 Codex 最高省 40% 成本、比 Pi 省 20%。
OpenAI 为 GPT-6 系列推出改进的提示词缓存系统,默认提高缓存命中率,对 30 分钟窗口内复用的合格共享前缀提供最高 90% 的缓存输入 token 折扣。
DigitalOcean 推出 Managed Agents,现已进入公开预览,可运行 Claude Code、Codex 或自建 LangGraph 智能体,并提供 75 个以上开放与专有模型可选。
Google 宣布 Google AI 订阅用户即日起可获 Colab 高级权益,包括优先使用更快的加速器和更强的机型。Google AI Ultra 订阅还解锁后台不间断执行和 Premium GPU,长训练任务无需保持浏览器标签页打开,权益将在未来几周内向 Colab 支持国家/地区的订阅用户推出,原 Colab 订阅不受影响且可与 Google AI 订阅权益叠加。