Google DeepMind 发布 Gemini Robotics ER 2 具身推理模型
Google DeepMind 发布 Gemini Robotics ER 2,定位为机器人的高层大脑,可理解物理世界、规划多步任务,并把动作执行交给底层 VLA 模型,同时支持调用 Google Search 等工具。
推荐理由:官方给出 ER 2 相对 ER 1.6 的能力升级与开放入口,读者可据此判断机器人在视频理解与多机协作上的进展。
文本之外的能力:视觉理解、图文混合、音视频输入输出的模型与产品进展。
Google DeepMind 发布 Gemini Robotics ER 2,定位为机器人的高层大脑,可理解物理世界、规划多步任务,并把动作执行交给底层 VLA 模型,同时支持调用 Google Search 等工具。
推荐理由:官方给出 ER 2 相对 ER 1.6 的能力升级与开放入口,读者可据此判断机器人在视频理解与多机协作上的进展。
Google DeepMind 发布 Gemini Robotics 2,由 Gemini Robotics 2、Gemini Robotics ER 2 和 Gemini Robotics On-Device 2 三款模型组成,首次实现对人形机器人从脚到指尖的全身控制,并支持双手与夹爪的精细操作和多机器人协作。
推荐理由:官方给出三款模型的定位与开放入口,可据此判断机器人全身控制与端侧适配的进展。
Google DeepMind 发布 Gemini 3.6 Flash、3.5 Flash-Lite 和面向代码安全的 3.5 Flash Cyber 三款模型。
推荐理由:官方给出三款 Flash 新模型的 token 效率、价格与基准对比,可据此判断智能体工作流的成本变化。
Google DeepMind 发布 Nano Banana 2 Lite 和 Gemini Omni Flash 两款模型。
推荐理由:两款新模型给出了延迟、单价与可用入口,读者可据此判断图像与视频生成链路的成本变化。
Google DeepMind 发布音频模型 Gemini 3.5 Live Translate,可自动检测 70+ 语言并生成保留说话人语调、节奏和音高的近实时语音翻译,全程仅落后说话人数秒。
推荐理由:Gemini 3.5 Live Translate 支持 70+ 语言连续语音翻译,并同步开放 API、Meet 与 Translate 入口,可据此判断实时翻译的落地节奏。
Google DeepMind 发布 Gemma 4 12B,一款面向笔记本本地运行的多模态模型,采用无编码器统一架构,视觉和音频输入直接进入 LLM 主干。该模型在标准基准上性能接近 26B MoE 模型,内存占用不到其一半,可在 16GB 显存或统一内存的设备上运行,并首次在中型模型中支持原生音频输入。
推荐理由:Gemma 4 12B 用无编码器架构把视觉和音频直接接入 LLM,读者可据此判断本地多模态智能体的硬件门槛。
Google DeepMind 发布 Omni 家族首个模型 Gemini Omni Flash,可组合图像、音频、视频和文本输入生成高质量视频,并通过自然语言多轮编辑视频。
推荐理由:Gemini Omni Flash 把对话式视频编辑和多模态输入整合进 Gemini 应用与 YouTube Shorts,可据此判断生成视频工作流的变化。
Google 宣布扩展内容透明度与验证工具,把 SynthID 的图像、视频、音频验证从 Gemini 应用扩展到搜索,并将在未来几周进入 Chrome;Gemini 应用即日起新增 C2PA Content Credentials 验证,搜索和 Chrome 将在未来几个月跟进。
推荐理由:Google 把 SynthID 与 C2PA 验证铺到搜索、Gemini、Chrome 和 Pixel,读者可了解内容溯源工具的实际覆盖范围。
Google DeepMind 发布 Gemini 3.5 系列首个模型 3.5 Flash,定位面向智能体与编码的前沿性能,即日起通过 Gemini app、Google Search 的 AI Mode、Google Antigravity、Gemini API、Android Studio 及 Gemini Enterprise 等渠道开放。
推荐理由:Gemini 3.5 Flash 的基准成绩、速度与开放渠道一并给出,可据此判断智能体与编码任务的成本变化。
Google DeepMind 宣布 AI co-clinician 研究计划,探索 AI 智能体在医生临床监督下协助患者诊疗。
推荐理由:Google DeepMind 公开 AI co-clinician 研究,给出医生盲评与实时多模态模拟的对比结果,可了解医疗智能体当前的能力边界。
Google DeepMind 发布 Gemini Robotics-ER 1.6,这是其面向机器人推理的模型升级版,重点增强空间推理与多视角理解,并新增仪表读数能力,可读取圆形压力表、液位指示器和数字读数。
推荐理由:官方给出与上一代及 Gemini 3.0 Flash 的对比,并首次开放仪表读数能力,可据此判断机器人在巡检场景的落地边界。