Gemini 上线智能体视频理解,按任务动态查看关键片段
Gemini API 上线智能体视频理解,可按问题动态检查画面、音频和字幕,支持上传视频与 YouTube 链接。功能适用于多款 Flash 模型,沿用标准 API 计价;谷歌测试中的节省幅度取决于任务,不能直接当作所有视频的成本承诺。
推荐理由:按问题选择视频片段改变了长视频分析的资源分配方式,开发者可据此设计更有针对性的检索和理解流程。
Gemini API 上线智能体视频理解,可按问题动态检查画面、音频和字幕,支持上传视频与 YouTube 链接。功能适用于多款 Flash 模型,沿用标准 API 计价;谷歌测试中的节省幅度取决于任务,不能直接当作所有视频的成本承诺。
推荐理由:按问题选择视频片段改变了长视频分析的资源分配方式,开发者可据此设计更有针对性的检索和理解流程。
微软研究院推出 GigaPath-Flash 和 GigaTIME-Flash,旨在通过蒸馏技术大幅降低计算成本以支持大规模病理研究。GigaPath-Flash 将十亿参数模型压缩至 22M 参数,在保持竞争力的同时实现约 50 倍的算力节省;GigaTIME-Flash 则提升了空间蛋白质组学预测效率并改善了泛化能力。两款模型均以 Apache 2.0 协议开源,专为科研设计而非临床诊断,使研究人员能在单 GPU 上处理百万级切片数据。
DeepSeek 于 8 月 31 日在 Hugging Face 开源首个多模态模型 DeepSeek-V4-Flash-Vision-Exp,采用 MIT License,公开模型文件、Tokenizer、Prompt Encoding 参考实现及最小化 PyTorch 推理实现。
推荐理由:原文梳理了模型开源内容与能力定位,读者可据此评估其在多模态 Agent 场景中的可用性。
Google DeepMind 发布 Gemini Omni 1.1 Flash,为开发者带来场景延长、首尾帧插值、360p 快速草稿和最高 4K 放大等生成视频控制能力。
推荐理由:官方给出场景延长、首尾帧插值与 4K 放大等具体能力与开放入口,可据此判断生成视频工作流的变化。
Microsoft Research 推出 MindTopo 基准,用于评估多模态大语言模型的拓扑推理能力,覆盖连通性、分离、顺序、包围与打结五类任务,并区分静态识别与交互规划两个认知层级。测试显示,当前专有与开源模型在静态推理上明显强于交互规划,且两者均远低于人类水平;失败多出现在规划阶段而非感知阶段,模型在场景变化后难以维持结构关系。图像与视频生成仅在单帧关系可见时偶有帮助,跨序列仍不可靠。
Google DeepMind 发布多语言手语转文本模型 SL2T,在 Gboard 和 Live Transcribe 中为 Pixel 11 提供手语听写功能,首发支持美国手语(ASL)转英文。
推荐理由:Google DeepMind 发布多语言手语转文本模型 SL2T,并首次落地 Gboard 与 Live Transcribe,可了解其数据规模与隐私设计。
Microsoft Research 发布研究模型 CARE-X,一个面向胸部 X 光多种临床解读任务的统一视觉语言模型,结合生成式与结构化预测,并用强化学习(DAPO)在多任务设置下奖励临床正确性。
Google DeepMind 发布 Gemini Robotics ER 2,定位为机器人的高层大脑,可理解物理世界、规划多步任务,并把动作执行交给底层 VLA 模型,同时支持调用 Google Search 等工具。
推荐理由:官方给出 ER 2 相对 ER 1.6 的能力升级与开放入口,读者可据此判断机器人在视频理解与多机协作上的进展。
Google DeepMind 发布 Gemini Robotics 2,由 Gemini Robotics 2、Gemini Robotics ER 2 和 Gemini Robotics On-Device 2 三款模型组成,首次实现对人形机器人从脚到指尖的全身控制,并支持双手与夹爪的精细操作和多机器人协作。
推荐理由:官方给出三款模型的定位与开放入口,可据此判断机器人全身控制与端侧适配的进展。
Google DeepMind 发布 Gemini 3.6 Flash、3.5 Flash-Lite 和面向代码安全的 3.5 Flash Cyber 三款模型。
推荐理由:官方给出三款 Flash 新模型的 token 效率、价格与基准对比,可据此判断智能体工作流的成本变化。
Google DeepMind 发布 Nano Banana 2 Lite 和 Gemini Omni Flash 两款模型。
推荐理由:两款新模型给出了延迟、单价与可用入口,读者可据此判断图像与视频生成链路的成本变化。
Google DeepMind 发布音频模型 Gemini 3.5 Live Translate,可自动检测 70+ 语言并生成保留说话人语调、节奏和音高的近实时语音翻译,全程仅落后说话人数秒。
推荐理由:Gemini 3.5 Live Translate 支持 70+ 语言连续语音翻译,并同步开放 API、Meet 与 Translate 入口,可据此判断实时翻译的落地节奏。
Google DeepMind 发布 Gemma 4 12B,一款面向笔记本本地运行的多模态模型,采用无编码器统一架构,视觉和音频输入直接进入 LLM 主干。该模型在标准基准上性能接近 26B MoE 模型,内存占用不到其一半,可在 16GB 显存或统一内存的设备上运行,并首次在中型模型中支持原生音频输入。
推荐理由:Gemma 4 12B 用无编码器架构把视觉和音频直接接入 LLM,读者可据此判断本地多模态智能体的硬件门槛。
Google DeepMind 发布 Omni 家族首个模型 Gemini Omni Flash,可组合图像、音频、视频和文本输入生成高质量视频,并通过自然语言多轮编辑视频。
推荐理由:Gemini Omni Flash 把对话式视频编辑和多模态输入整合进 Gemini 应用与 YouTube Shorts,可据此判断生成视频工作流的变化。
Google 宣布扩展内容透明度与验证工具,把 SynthID 的图像、视频、音频验证从 Gemini 应用扩展到搜索,并将在未来几周进入 Chrome;Gemini 应用即日起新增 C2PA Content Credentials 验证,搜索和 Chrome 将在未来几个月跟进。
推荐理由:Google 把 SynthID 与 C2PA 验证铺到搜索、Gemini、Chrome 和 Pixel,读者可了解内容溯源工具的实际覆盖范围。
Google DeepMind 宣布与新加坡政府达成国家 AI 合作,在医疗、科研、教育和气候领域落地新项目。合作包括探索 AI 辅助临床的「三方照护」模式、用 AlphaFold 和 Google Earth 推进东南亚传染病研究,并向新加坡中小学至初级学院全体教育者提供 Gemini for Education。
Google DeepMind 发布 Gemini 3.5 系列首个模型 3.5 Flash,定位面向智能体与编码的前沿性能,即日起通过 Gemini app、Google Search 的 AI Mode、Google Antigravity、Gemini API、Android Studio 及 Gemini Enterprise 等渠道开放。
推荐理由:Gemini 3.5 Flash 的基准成绩、速度与开放渠道一并给出,可据此判断智能体与编码任务的成本变化。
Google DeepMind 宣布 AI co-clinician 研究计划,探索 AI 智能体在医生临床监督下协助患者诊疗。
推荐理由:Google DeepMind 公开 AI co-clinician 研究,给出医生盲评与实时多模态模拟的对比结果,可了解医疗智能体当前的能力边界。
Google DeepMind 发布 Gemini Robotics-ER 1.6,这是其面向机器人推理的模型升级版,重点增强空间推理与多视角理解,并新增仪表读数能力,可读取圆形压力表、液位指示器和数字读数。
推荐理由:官方给出与上一代及 Gemini 3.0 Flash 的对比,并首次开放仪表读数能力,可据此判断机器人在巡检场景的落地边界。