上海AI实验室发布 InternLumina-U2:16B-A1B 多码本扩散统一多模态模型
上海AI实验室发布 InternLumina-U2,一个 16B 参数(激活 1B)的 MoE 扩散语言模型,用 8 码本全离散视觉表示统一覆盖文本问答、文生图、图像理解与编辑、视频及 3D 理解。
推荐理由:原文给出多码本全离散统一架构的设计细节、基准分数和双硬件适配说明,读者可以了解统一理解与生成模型的一条新路线。
新模型的发布、开源与迭代:大模型厂商的旗舰更新、开源权重放出、性能与价格变化的第一时间记录。
上海AI实验室发布 InternLumina-U2,一个 16B 参数(激活 1B)的 MoE 扩散语言模型,用 8 码本全离散视觉表示统一覆盖文本问答、文生图、图像理解与编辑、视频及 3D 理解。
推荐理由:原文给出多码本全离散统一架构的设计细节、基准分数和双硬件适配说明,读者可以了解统一理解与生成模型的一条新路线。
Runway 发布 Solaris,称其为新模型家族 Interface World Models 的第一个模型,由世界模型实时逐帧生成界面并对点击、拖拽等交互作出响应,无需代码等中间表示。
推荐理由:官方完整披露了模型机制、用户研究和局限,读者可以据此理解去除中间表示后界面生成与智能体训练的路径。
Muse Voice Transcribe 提供流式语音识别、说话人区分和端点检测,已用于 Meta AI、Muse Code 并通过模型 API 提供。模型训练覆盖七十多种语言,其中二十五种经过深入验证;支持语言切换不代表所有语言质量完全相同。
推荐理由:实时转写同时输出说话人和语言变化,为会议及编程助手保留对话结构,便于后续检索和任务处理。
DeepSeek 于 8 月 31 日在 Hugging Face 开源首个多模态模型 DeepSeek-V4-Flash-Vision-Exp,采用 MIT License,公开模型文件、Tokenizer、Prompt Encoding 参考实现及最小化 PyTorch 推理实现。
推荐理由:原文梳理了模型开源内容与能力定位,读者可据此评估其在多模态 Agent 场景中的可用性。
Google DeepMind 发布 Gemini Omni 1.1 Flash,为开发者带来场景延长、首尾帧插值、360p 快速草稿和最高 4K 放大等生成视频控制能力。
推荐理由:官方给出场景延长、首尾帧插值与 4K 放大等具体能力与开放入口,可据此判断生成视频工作流的变化。
Google 发布 Gemini 3.5 Transcribe,称其为目前最精确的语音转文字模型,可将原始音频直接转为准确、格式化文本。据 Artificial Analysis 测量,流式场景平均词错误率 4.0%,非流式 2.6%;相比上一代 Chirp 3,最终转写时间改善 70%,FLEURS 基准上流式 WER 为 5.50%、非流式为 5.04%。
推荐理由:Gemini 3.5 Transcribe 的 WER、延迟与多语言数据,可用来判断实时语音转写当前的能力水位。
Google DeepMind 发布 Gemini 3.7 Flash,定位为面向编码与智能体的最强主力模型,距 Gemini 3.6 Flash 发布仅三周。
推荐理由:官方给出与 3.6 Flash 的多项基准对比和半价定价,可据此判断编码与智能体场景的成本变化。
Google DeepMind 发布多语言手语转文本模型 SL2T,在 Gboard 和 Live Transcribe 中为 Pixel 11 提供手语听写功能,首发支持美国手语(ASL)转英文。
推荐理由:Google DeepMind 发布多语言手语转文本模型 SL2T,并首次落地 Gboard 与 Live Transcribe,可了解其数据规模与隐私设计。
Google DeepMind 在 Nature 发表论文,称 WeatherNext AI 模型在预测气旋路径、强度和风场结构上达到 SOTA,平均为预报员多争取一天预警时间,三天预报精度相当于此前模型的两天水平。
推荐理由:原文给出气旋预报多出一天预警时间的实测结果与开源入口,读者可据此判断气象 AI 的可用边界。
Google DeepMind 发布 Gemini Robotics ER 2,定位为机器人的高层大脑,可理解物理世界、规划多步任务,并把动作执行交给底层 VLA 模型,同时支持调用 Google Search 等工具。
推荐理由:官方给出 ER 2 相对 ER 1.6 的能力升级与开放入口,读者可据此判断机器人在视频理解与多机协作上的进展。
Google DeepMind 发布 Gemini Robotics 2,由 Gemini Robotics 2、Gemini Robotics ER 2 和 Gemini Robotics On-Device 2 三款模型组成,首次实现对人形机器人从脚到指尖的全身控制,并支持双手与夹爪的精细操作和多机器人协作。
推荐理由:官方给出三款模型的定位与开放入口,可据此判断机器人全身控制与端侧适配的进展。
Google DeepMind 发布 Gemini 3.6 Flash、3.5 Flash-Lite 和面向代码安全的 3.5 Flash Cyber 三款模型。
推荐理由:官方给出三款 Flash 新模型的 token 效率、价格与基准对比,可据此判断智能体工作流的成本变化。
Google DeepMind 发布 Gemini 3.5 Flash Cyber,这是基于 3.5 Flash 微调的轻量网络安全模型,用于快速发现、验证和修补漏洞,在 CyberGym 等基准上以多次调用取得接近更大模型的成绩。
推荐理由:Google 把轻量 Flash 微调成专用安全模型,并给出 CyberGym 与 Chrome 流水线的实测对比,可看专用小模型在漏洞挖掘上的取舍。
Google DeepMind 发布 Nano Banana 2 Lite 和 Gemini Omni Flash 两款模型。
推荐理由:两款新模型给出了延迟、单价与可用入口,读者可据此判断图像与视频生成链路的成本变化。
Google DeepMind 发布实验性开源模型 DiffusionGemma,采用文本扩散方式并行生成整块文本,在专用 GPU 上推理速度最高提升 4 倍。
推荐理由:Google DeepMind 开源文本扩散模型,给出 4x 推理加速与本地部署的硬件门槛,可据此判断速度优先场景的取舍。
Google DeepMind 发布音频模型 Gemini 3.5 Live Translate,可自动检测 70+ 语言并生成保留说话人语调、节奏和音高的近实时语音翻译,全程仅落后说话人数秒。
推荐理由:Gemini 3.5 Live Translate 支持 70+ 语言连续语音翻译,并同步开放 API、Meet 与 Translate 入口,可据此判断实时翻译的落地节奏。
Google DeepMind 发布 Gemma 4 12B,一款面向笔记本本地运行的多模态模型,采用无编码器统一架构,视觉和音频输入直接进入 LLM 主干。该模型在标准基准上性能接近 26B MoE 模型,内存占用不到其一半,可在 16GB 显存或统一内存的设备上运行,并首次在中型模型中支持原生音频输入。
推荐理由:Gemma 4 12B 用无编码器架构把视觉和音频直接接入 LLM,读者可据此判断本地多模态智能体的硬件门槛。
Google DeepMind 发布 Omni 家族首个模型 Gemini Omni Flash,可组合图像、音频、视频和文本输入生成高质量视频,并通过自然语言多轮编辑视频。
推荐理由:Gemini Omni Flash 把对话式视频编辑和多模态输入整合进 Gemini 应用与 YouTube Shorts,可据此判断生成视频工作流的变化。
Google DeepMind 发布 Gemini 3.5 系列首个模型 3.5 Flash,定位面向智能体与编码的前沿性能,即日起通过 Gemini app、Google Search 的 AI Mode、Google Antigravity、Gemini API、Android Studio 及 Gemini Enterprise 等渠道开放。
推荐理由:Gemini 3.5 Flash 的基准成绩、速度与开放渠道一并给出,可据此判断智能体与编码任务的成本变化。
Google DeepMind 发布 Gemini 3.1 Flash TTS 文本转语音模型,在 Artificial Analysis TTS 榜单上取得 1,211 Elo 分数,并支持 70 多种语言和原生多说话人对话。
推荐理由:官方给出 Gemini 3.1 Flash TTS 的 Elo 分数、音频标签控制方式和多平台开放入口,可据此判断语音生成的可控性变化。