Google DeepMind 发布 AlphaGenome Atlas 基因组预测图谱
Google DeepMind 发布 AI 工具 AlphaGenome Atlas,包含对人类基因组约 90 亿种单字母替换变体的分子层面影响预测,数据集规模约 1 petabyte。
Google DeepMind 发布 AI 工具 AlphaGenome Atlas,包含对人类基因组约 90 亿种单字母替换变体的分子层面影响预测,数据集规模约 1 petabyte。
Adobe 宣布重新设计 Premiere 的 AI 交互,新的生成式媒体工具支持在时间线空白区域直接生成视频、音效、音乐和声景,无需切换应用。时间线可调用 Adobe Firefly、谷歌 Veo、Runway、Luma 和可灵等多种底层模型。
DeepSeek 今日在官方交流群通知 DeepSeek V4.1 Flash 中间版本开启内测,采用新模型结构,原生多模态支持,能力更强、速度更快、成本更低。
小米宣布 Xiaomi MiMo Desktop 桌面客户端正式开放邀测,通过申请的用户可限时限量免费体验 MiMo-X-Pro-Preview 和 MiMo-X-Flash-Preview 两款新一代模型 Preview 版。
Xiaomi MiMo Desktop 桌面客户端携两款新一代模型 Preview 版(MiMo-X-Pro-Preview、MiMo-X-Flash-Preview)正式开放邀测,用户可提交申请限时免费体验。
Reducto 发布 r-1,用一次全页解析替代多阶段 agentic OCR 流水线,官方称相较自家旧管线错误率降低 20%,价格从每页 3 至 6 美分降至 1 美分全包。r-1 原生处理表格、阅读顺序、格式和边界框 grounding,需 V3 Parse API 通过 settings.model 开启,暂无开源权重;对标 Amazon Textract 等的评测为厂商自测,未公开数据集。
微信支付上线智能眼镜 SDK,将扫一扫支付能力封装后向符合标准的智能眼镜厂商开放,Rokid 乐奇 AI 眼镜为首款适配产品。用户需先在厂商 App 开通并验证支付密码,日常付款分唤起、扫码、滑动镜腿确认、语音播报四步,基础版每日限额 200 元,具备虹膜或指纹等身份识别的设备可享更高额度。SDK 目前处于 Beta 阶段,仅支持扫描收款码付款,暂不支持小程序码、加好友等场景。
Arm 在上海 Arm Everywhere China 活动上发布第二代移动终端计算子系统 CSS for Mobile 2,集成 Arm C2 CPU 集群、Mali G2-Ultra NX GPU 和 SI L2 系统互连,面向智能体 AI 与 AI 原生图形。
微信 AI 于 9 月 4 日宣布开源通用多模态嵌入模型 WeMM-Embedding,包含 2B、4B、9B 三个版本,支持文本、图像、视频、视觉文档及任意交错的多模态输入。
一名 AI 爱好者 CozyBlaze 让 OpenAI 新旗舰模型 GPT-6 Astra 自主通关了 Valve 的 3D 解谜游戏《传送门》,全程约 24 小时,共进行 3336 次工具调用,按 API 价格计算约 571.18 美元,但实际成本由其每月 200 美元的 Codex Pro 订阅覆盖。
据彭博社报道,字节跳动正开发实时空间视频生成 AI 模型,创始人张一鸣亲自督导研发,计划最早下月发布,发布时间尚未最终确定。该模型基于电影级视频生成模型 Seedance 构建,面向直播、短剧和游戏创建交互式虚拟世界,可在每秒 20 帧帧率下以约 50 毫秒延迟按需生成视频流,响应 Pico 头显用户的语音或动作。
阿里巴巴 Qwen 团队发布 Qwen-Drive 1.0,基于 Qwen3.5-4B,在语言模型上叠加 3D 环境感知和路径规划两个模块,用同一模型同时服务驾驶系统和座舱助手。
京东 JoyAI App 推出可实时视频购物的 AI 数字人,通过“万能博士”在视频通话内实时解析商品画面、调取京东商品并直接下单,全程不切换 App。用户上传一张图片即可自定义数字人形象、人设、音色和交互场景,数字人还支持点外卖、订酒店、健康咨询、金融咨询等服务,支付环节搭载京东 AI 付声纹验证。今年以来 JoyAI App 对话用户数增速超过 15 倍。
Arena(arena.ai)平台发布 2026 年第 36 周(8 月 31 日~9 月 6 日)AI 大模型盲测排名。
阿里云 9 月 7 日宣布千问办公推出业内首个多人工作台,用户用自然语言描述需求即可生成并发布最多支持百人同时在线协作的网页。该功能具备角色权限、云端数据库、管理后台和在线发布四项核心能力,适用于活动组织、家校协同和企业协作等场景,可从千问办公首页功能入口直接体验。
DF26 基准针对单人物公开演讲场景评测 AI 生成视频检测,包含 271 个真实视频和由七个现代视频模型生成的 2,420 个合成视频。结果显示人类和最先进的 deepfake 检测器准确率都接近随机水平,暴露出当前评测协议的局限,并提出了对现代生成模型分布偏移保持鲁棒性的基准需求。
H Company 发布 NeoMME 系列多模态编码器,包含 260M 和 800M 两个双向 Transformer 模型,用单一塔处理多语言文本和 32×32 图像块,去掉了独立视觉塔和因果解码器,以离散掩码扩散方式预训练。
Google Research 与 DeepMind 发布 AI 天气模型 WeatherNext 3,不再依赖传统物理模拟,直接处理实时地球静止卫星数据,每小时生成一次预报。
Google 在 Gemini app 和 API 中发布 Lyria 3.5 音乐生成模型,官方称其人声表现力和编曲丰富度超过前代。用户可在 app 中选择流派、风格、人声或纯器乐,生成长短曲目,还提供背景音乐和个性化生日歌模板。
作者实测 GPT-6 Astra 的电脑自动化、3D 和剪辑能力。外置键盘快捷键配置 41 秒一次成功,Blender 海盗船不到 10 分钟完成且给出逐部位生成逻辑,还用关键帧做出 3D 镜头移动视频和星球状的马里奥 3D 游戏关卡。真人口播剪辑经三次修改达到可发布标准,附完整剪辑提示词;PPT 二次美化评定为 6 到 7 分;UI 设计对比仍不及 Claude Fable 5.1。
阿里千问本周开源 Qwen-Drive-1.0-4B,一款基于 Qwen3.5-4B 构建的自动驾驶视觉语言基础模型,官方称其为首个面向自动驾驶的视觉语言基础模型。
OpenAI 应用研究主管鲍里斯·鲍尔 9 月 6 日在 X 平台表示,空间推理曾是人类大幅领先计算机的少数优势之一,有了 Astra 模型后这一差距已不复存在。
公安部宣布,由公安部刑侦局指导、上海市公安局自主研发的“国家反诈 AI”App 正式上线,微信、支付宝小程序同步开放,用户可在各大手机应用市场下载。该 App 融合大语言、多模态模型和智能体技术,提供 AI 大模型智能问答、反诈资讯和反诈辞典三大功能,可对用户输入的可疑场景完成风险研判、识别诈骗套路并推送典型案例,从文字、语音、视频多个维度拆解诈骗手法并提供防范对策。
蚂蚁 inclusionAI 在 Hugging Face 发布 LLaDA-UI,一个基于 MoE 的块扩散视觉语言 GUI 智能体,总参数约 16.7B,语言骨干为 LLaDA2.0-mini-base。
Simon Willison 分享对面向开发者的 GPT-6 Astra 的试用印象:Astra 在细节把握、理解用户提示词和构建更复杂输出方面全面提升,尤其擅长 3D 建模,他见过它生成花园、船厂、动物、城市景观甚至戴森球的精美渲染,并成功生成了骑自行车的鹈鹕戴红色领巾的场景。
Zho 用 GPT-6 Astra 跑了超过 12 小时的地狱难度测试,输入为单张建筑照片加提示词,5 项任务总得分 60/100(及格线),消耗 token 2.1 亿。
9 月 5 日上午,解放军总医院第六医学中心心血管病医学部完成人工智能超声机器人引导下先天性心脏病介入封堵术,经科技查新为全球首例同类智能技术临床应用。患者为 48 岁男性,确诊房间隔缺损且缺损边缘解剖条件较差。该系统由朱航主任团队与清华科研团队联合研发,通过机械臂自主扫查、AI 自动甄别病灶、构建心脏三维模型并规划手术路径,实现影像识别与手术操作的双向智能协同,提升了手术精准度与安全性。
ZHO 实测 GPT-6 Astra(ChatGPT Work,Ultra 档),输入一张建筑照片和一条地狱难度提示词,让模型基于传统工作流重建建筑。
Artificial Analysis 发布 Intelligence Index v4.2 中期更新,新增私有测试集评测 AA-Briefcase(智能体知识工作)和 Surge AI 的 GDP.pdf(跨 100 份 PDF、4,592 页的长文文档推理,按 1,275 条专家标准全过评分),并移除已饱和的 GPQA Diamond。
Google 在 Gemini Flash 系列模型上推出 agentic 视频理解,模型不再按固定 1 FPS 单遍读取视频,而是按需加载帧、音频和转录文本。
百度智能云介绍与杭州加南科技的合作:F2 AR智能眼镜不配置摄像头,通过PPG心率、IMU、语音、位置与交互信号为AI提供用户上下文,心率偏离基线时可结合情境生成可确认或忽略的状态提示,并形成Heart Moment心情可视化功能。架构上终端负责感知与AR呈现,云端由百度智能云提供大模型、实时语音、翻译、百度地图与百舸、千帆等能力,形成端云协同的一体化方案。
据 Windows Latest 报道,微软计划为 Excel 推出 Copilot Canvas 功能,可将工作簿中的图表、关键指标和分析洞察整合为交互式画布,并支持自然语言对话修改内容。画布保持连接原始工作簿,数据变化后自动更新,微软计划未来几周逐步推送并预计 10 月初完成部署。
据 MacObserver 报道,苹果计划在 2027 年推出全新家庭安全监控服务,作为拓展智能家居业务的一部分。同时苹果正研发一款注重隐私保护的家庭安防摄像头及自动化设备,利用 AI 分析周围环境而无需传统摄像头持续录制视频。该服务预计成为新的订阅项目,可能与新款 Apple TV 4K、HomePod mini、家庭中枢设备 HomePad 协同,未来也可能纳入 Apple One 套餐。
谷歌于 9 月 5 日宣布在 Gemini 应用和 Gemini API 中上线音乐生成模型 Lyria 3.5,可生成含数段副歌、桥段等数分钟完整歌曲,用户可通过 gemini.google.com/music 网站和应用使用。