Google DeepMind 发布 EmbeddingGemma 2 开源多模态嵌入模型
Google DeepMind 发布 EmbeddingGemma 2,将文本、代码、图像、视频和音频映射到统一嵌入空间,采用 Apache 2.0 许可,参数量 7.4 亿。
推荐理由:EmbeddingGemma 2 把文本、图像、音频、视频统一到同一嵌入空间,并给出端侧内存与向量截断的具体数据,便于判断本地检索与 RAG 的可行性。
Google DeepMind 发布 EmbeddingGemma 2,将文本、代码、图像、视频和音频映射到统一嵌入空间,采用 Apache 2.0 许可,参数量 7.4 亿。
推荐理由:EmbeddingGemma 2 把文本、图像、音频、视频统一到同一嵌入空间,并给出端侧内存与向量截断的具体数据,便于判断本地检索与 RAG 的可行性。
NVIDIA Inception 计划中的多家初创公司正用 AI 覆盖乳腺癌筛查、风险评估与治疗规划环节。iSono Health 的 FDA 认证 ATUSA 可穿戴 3D 超声系统约两分钟完成单侧乳房标准化扫描,公司称其灵敏度比手持 2D 超声高 28%;Whiterabbit.ai 的 WRDensity 已用于数十万患者,并研发新一代乳腺 X 光 AI。
Condé Nast 与 AWS 生成式 AI 创新中心(GenAIIC)合作,基于 Amazon Bedrock 和 Amazon OpenSearch Service 构建多模态视频检索方案,将单次内容发现任务耗时从平均 250 分钟降至 2 分钟以内。
Microsoft Research 推出 Quine,一个包含生物学世界模型和交互式 harness 的 AI 研究系统,可跨基因组、蛋白质、化学、细胞状态和生物成像等模态联合学习并推理干预后果。
推荐理由:原文给出 PDAC 化合物筛选一个周末完成并经湿实验验证的结果,读者可据此评估 AI 驱动生物发现的实际路径。
MiniCPM-o 4.5 现已支持 SGLang Omni v0.1.7。 为开发者提供更多灵活运行和构建该模型的方式。
LlamaIndex 发文解释表单为何需要专用解析器:VLM 擅长通用推理,但表单解析结果并不会随推理增强而变好,且成本更高。LlamaParse 将表单表示为带 id、label、value 的字段与 section 嵌套 JSON 树,能保留复选框、签名及字段归属关系,避免扁平化后两个 "Date" 字段无法区分。
可灵AI宣布全新升级的 Kling 4.0 将于 10 月正式上线,Kling 4.0 Flash 已于 9 月 28 日向黑金年卡会员开放小范围抢先体验。
9月27日,昆仑万维旗下SkyProduction(天工工作台)上线三项新能力:开放AI MV创作功能;无限画布接入Mureka V8/V9/V9.5音乐生成模型;视频和图片支持智能配乐。用户可在同一画布完成从音乐分析、分镜规划到视频生成的全流程,并调用Seedance 2.5模型生成视频片段。
H Company 发布 Holo4 的二百七十亿参数稠密模型和混合专家版本,提供 API、可下载权重与多种量化格式。模型把桌面、网页、安卓操作及代码和工具调用结合在同一智能体中;不同测试平台的分数不能直接横向比较。
推荐理由:开放权重和量化版本让团队能在自有环境尝试界面操作智能体,并对不同设备和工具组合开展实际任务评测。
阿里千问App联合盒马和淘宝闪购,推出“盒马菜谱”和“淘宝闪购异地美食”两大智能体技能。用户可通过文字指令、拍摄冰箱食材或宴席照片获取家宴方案及做法,并一键下单购买食材;旅游时也可查询当地特色美食推荐并直接配送。该功能旨在通过AI辅助解决假期饮食规划与采购问题。
Google Research 提出基于 Gemini 和 Veo 的多智能体编排框架,将长视频生成建模为全局优化与世界状态跟踪问题,包含 Co-Director(COLM 2026)、CANVAS(EMNLP 2026)、A²RD 和 VQQA 四个框架,支持 SynthID 水印。
Liquid AI 为视觉语言模型 LFM2.5-VL-3B 发布实验性 DSpark drafter 模型,参数约 280M,仅增加 8.9% 参数量。GPU 上解码吞吐最高提升 2.66 倍、边缘设备 3.13 倍,端到端分别最高 2.27 倍和 2.62 倍;模型已上架 Hugging Face,支持 llama.cpp、SGLang 和 MLX-VLM。
Liquid AI 在 Hugging Face 发布面向视觉语言模型 LFM2.5-VL-3B 的实验性 DSpark 草稿模型,通过投机解码在不改变输出质量的前提下换取推理加速。
Meta 宣布将 Private Processing 机密计算基础设施扩展到 Meta AI 眼镜,把信任边界延伸到云端 CVM,使包括 Meta 在内的任何人都无法访问用户数据。
Runway 发布 DaVinci Resolve 插件,可在 Resolve Studio 内直接生成图像和视频、重绘播放头下的片段,并将结果导入媒体池和时间线。
推荐理由:官方发布说明讲清了插件的核心工作流变化和版本要求,剪辑师可以据此评估是否把生成环节搬进 Resolve。
Qwen 发布 Qwen Intelligence,推出三款移动端智能体:Mobile Planner Agent 规划与编排复杂任务,在 MobilePA-Bench。
腾讯混元发布混元图像 3.5 预览版(Hy Image3.5 preview),官方称综合能力较 Hy Image3.0 提升约 30%,内部数百名设计师 GSB 盲测中与 Seedream 5.0 pro 持平,略优于 Nano-Banana Pro 和 Qwen-Image-3.0 Pro。
小米 MiMo-V2.6 系列三款模型上线 OpenRouter,包括 1T+ 参数旗舰、开源 MoE 模型和约 10 倍速的旗舰变体。三款模型均支持文本、图像、视频和音频输入,上下文为 1M。
推荐理由:官方发布全模态模型并开放权重、技术报告和训练代码,附与 Claude Opus 5、GPT-5.6 Sol 的 Agent 基准对比数据。
Xiaomi MiMo 于今日正式发布并开源 MiMo-V2.6 系列模型,包含 Pro 与 Flash 两个原生全模态模型,称这是探索 RSI(递归自我改进)路径的关键一步。
Microsoft Research 在 Nature 发表逆合成预测模型 RetroChimera,结合基于 Transformer 的 R-SMILES 2 和图神经网络模型 NeuralLoc,用 learning-to-rank 集成两者互补预测。
Qwen 发布 Qwen3.8-LiveTranslate,采用 Interleave 架构与 Hybrid-MoE Thinker–Talker 设计重构实时同声传译,平均滞后(LAAL)从上一代的 2.8 秒降至 2.3 秒。
推荐理由:官方给出了架构设计、LAAL 从 2.8 秒到 2.3 秒的数字和多语言评测结果,读者可以据此评估其实时翻译能力的实际变化。
通义千问发布 Qwen3.8-Omni-Flash,是 Qwen 首个以智能体能力为核心构建的全模态模型,支持原生音视频理解、推理和工具调用。
Google Research 发布新研究实验,让教育者用针对学习优化的生成式用户界面(GenUI)动态生成符合其教学目标的互动学习模拟。
Qwen 发布下一代原生全模态模型 Qwen3.8-Omni-Flash,支持文本、图像、音频和视频输入及 1M token 上下文窗口,29 项评测平均分较 Qwen3.5-Omni-Plus 提升超过 25%,音频输入每小时价格下降超过 98%,音视频输入每小时价格下降超过 93%。
推荐理由:官方发布同时开放 API 和开源插件与运行时,读者可以据此评估音视频智能体在剪辑、会议、实时交互等工作流中的落地方式。
浙江大学等高校的外部研究者以 MiniCPM-o 4.5 为基座后训练,开源了端到端全模态交互智能体 Gander,论文、数据、代码和模型全部开放。
Google 在 Gemini API 和 Google AI Studio 发布 Gemini 3.8 Live 与 3.8 Live Extended Thinking 语音模型,支持异步函数调用、视觉上下文、97+ 语言和可配置思考,Extended Thinking 版位列 Artificial Analysis 语音到语音榜单第一。
NVIDIA Vera Rubin NVL72 首次提交 MLPerf Inference v6.1 preview 结果,Qwen3-VL 上吞吐最高达 GB300 NVL72 的 3.7 倍,DeepSeek-R1 上最高 2.5 倍。