跳到正文

#多模态

今日 4 条
9月1日周二
  1. Google DeepMind77

    Gemini 上线智能体视频理解,按任务动态查看关键片段

    Gemini API 上线智能体视频理解,可按问题动态检查画面、音频和字幕,支持上传视频与 YouTube 链接。功能适用于多款 Flash 模型,沿用标准 API 计价;谷歌测试中的节省幅度取决于任务,不能直接当作所有视频的成本承诺。

    推荐理由:按问题选择视频片段改变了长视频分析的资源分配方式,开发者可据此设计更有针对性的检索和理解流程。

  2. Microsoft Research 博客(RSS)72

    微软研究院发布高效病理基础模型 GigaPath-Flash 与 GigaTIME-Flash

    微软研究院推出 GigaPath-Flash 和 GigaTIME-Flash,旨在通过蒸馏技术大幅降低计算成本以支持大规模病理研究。GigaPath-Flash 将十亿参数模型压缩至 22M 参数,在保持竞争力的同时实现约 50 倍的算力节省;GigaTIME-Flash 则提升了空间蛋白质组学预测效率并改善了泛化能力。两款模型均以 Apache 2.0 协议开源,专为科研设计而非临床诊断,使研究人员能在单 GPU 上处理百万级切片数据。

8月31日周一
  1. IT之家(RSS)77

    DeepSeek-V4-Flash-Vision-Exp 模型已开源,多模态 Agent 能力接近 Opus-4.8

    DeepSeek 于 8 月 31 日在 Hugging Face 开源首个多模态模型 DeepSeek-V4-Flash-Vision-Exp,采用 MIT License,公开模型文件、Tokenizer、Prompt Encoding 参考实现及最小化 PyTorch 推理实现。

    推荐理由:原文梳理了模型开源内容与能力定位,读者可据此评估其在多模态 Agent 场景中的可用性。

8月28日周五
  1. Google DeepMind71

    Google DeepMind 发布 Gemini Omni 1.1 Flash

    Google DeepMind 发布 Gemini Omni 1.1 Flash,为开发者带来场景延长、首尾帧插值、360p 快速草稿和最高 4K 放大等生成视频控制能力。

    推荐理由:官方给出场景延长、首尾帧插值与 4K 放大等具体能力与开放入口,可据此判断生成视频工作流的变化。

8月13日周四
  1. Microsoft Research38

    微软发布 MindTopo 基准,揭示多模态模型拓扑推理短板

    Microsoft Research 推出 MindTopo 基准,用于评估多模态大语言模型的拓扑推理能力,覆盖连通性、分离、顺序、包围与打结五类任务,并区分静态识别与交互规划两个认知层级。测试显示,当前专有与开源模型在静态推理上明显强于交互规划,且两者均远低于人类水平;失败多出现在规划阶段而非感知阶段,模型在场景变化后难以维持结构关系。图像与视频生成仅在单帧关系可见时偶有帮助,跨序列仍不可靠。

8月12日周三
7月30日周四
  1. Google DeepMind71

    Google DeepMind 发布 Gemini Robotics ER 2 具身推理模型

    Google DeepMind 发布 Gemini Robotics ER 2,定位为机器人的高层大脑,可理解物理世界、规划多步任务,并把动作执行交给底层 VLA 模型,同时支持调用 Google Search 等工具。

    推荐理由:官方给出 ER 2 相对 ER 1.6 的能力升级与开放入口,读者可据此判断机器人在视频理解与多机协作上的进展。

7月28日周二
  1. Google DeepMind74

    Google DeepMind 发布 Gemini Robotics 2,实现机器人全身控制

    Google DeepMind 发布 Gemini Robotics 2,由 Gemini Robotics 2、Gemini Robotics ER 2 和 Gemini Robotics On-Device 2 三款模型组成,首次实现对人形机器人从脚到指尖的全身控制,并支持双手与夹爪的精细操作和多机器人协作。

    推荐理由:官方给出三款模型的定位与开放入口,可据此判断机器人全身控制与端侧适配的进展。

7月21日周二
7月1日周三
6月9日周二
  1. Google DeepMind78

    Google DeepMind 发布 Gemini 3.5 Live Translate 实时语音翻译模型

    Google DeepMind 发布音频模型 Gemini 3.5 Live Translate,可自动检测 70+ 语言并生成保留说话人语调、节奏和音高的近实时语音翻译,全程仅落后说话人数秒。

    推荐理由:Gemini 3.5 Live Translate 支持 70+ 语言连续语音翻译,并同步开放 API、Meet 与 Translate 入口,可据此判断实时翻译的落地节奏。

  2. Google DeepMind78

    Google DeepMind 发布 Gemma 4 12B:统一无编码器多模态模型

    Google DeepMind 发布 Gemma 4 12B,一款面向笔记本本地运行的多模态模型,采用无编码器统一架构,视觉和音频输入直接进入 LLM 主干。该模型在标准基准上性能接近 26B MoE 模型,内存占用不到其一半,可在 16GB 显存或统一内存的设备上运行,并首次在中型模型中支持原生音频输入。

    推荐理由:Gemma 4 12B 用无编码器架构把视觉和音频直接接入 LLM,读者可据此判断本地多模态智能体的硬件门槛。

5月18日周一
5月17日周日
  1. Google DeepMind71

    Google 将 SynthID 与 C2PA 内容验证扩展到搜索、Gemini、Chrome 和 Pixel

    Google 宣布扩展内容透明度与验证工具,把 SynthID 的图像、视频、音频验证从 Gemini 应用扩展到搜索,并将在未来几周进入 Chrome;Gemini 应用即日起新增 C2PA Content Credentials 验证,搜索和 Chrome 将在未来几个月跟进。

    推荐理由:Google 把 SynthID 与 C2PA 验证铺到搜索、Gemini、Chrome 和 Pixel,读者可了解内容溯源工具的实际覆盖范围。

5月16日周六
  1. Google DeepMind88

    Google DeepMind 发布 Gemini 3.5 Flash,主打智能体与编码

    Google DeepMind 发布 Gemini 3.5 系列首个模型 3.5 Flash,定位面向智能体与编码的前沿性能,即日起通过 Gemini app、Google Search 的 AI Mode、Google Antigravity、Gemini API、Android Studio 及 Gemini Enterprise 等渠道开放。

    推荐理由:Gemini 3.5 Flash 的基准成绩、速度与开放渠道一并给出,可据此判断智能体与编码任务的成本变化。

4月30日周四
4月13日周一
  1. Google DeepMind66

    Google DeepMind 发布 Gemini Robotics-ER 1.6,新增仪表读数能力

    Google DeepMind 发布 Gemini Robotics-ER 1.6,这是其面向机器人推理的模型升级版,重点增强空间推理与多视角理解,并新增仪表读数能力,可读取圆形压力表、液位指示器和数字读数。

    推荐理由:官方给出与上一代及 Gemini 3.0 Flash 的对比,并首次开放仪表读数能力,可据此判断机器人在巡检场景的落地边界。