Google DeepMind 发布 EmbeddingGemma 2 开源多模态嵌入模型
Google DeepMind 发布 EmbeddingGemma 2,将文本、代码、图像、视频和音频映射到统一嵌入空间,采用 Apache 2.0 许可,参数量 7.4 亿。
推荐理由:EmbeddingGemma 2 把文本、图像、音频、视频统一到同一嵌入空间,并给出端侧内存与向量截断的具体数据,便于判断本地检索与 RAG 的可行性。
Google DeepMind 发布 EmbeddingGemma 2,将文本、代码、图像、视频和音频映射到统一嵌入空间,采用 Apache 2.0 许可,参数量 7.4 亿。
推荐理由:EmbeddingGemma 2 把文本、图像、音频、视频统一到同一嵌入空间,并给出端侧内存与向量截断的具体数据,便于判断本地检索与 RAG 的可行性。
Google DeepMind 推出 SynthID Bio,将水印技术引入合成生物学,把不可感知的签名直接嵌入生物代码,使水印不仅能在数字模型上验证,也能在合成出的实体蛋白质上验证,同时保持其生物功能。
推荐理由:SynthID 水印技术首次延伸到合成生物学,读者可了解 AI 生成蛋白质如何在保留功能的同时被标记与验证。
Google DeepMind 发布前沿模型 Gemini 4 Argon,先通过 Fairwind Program 向受信任的网络安全防御方开放,随后逐步扩展至开发者、企业和消费者。
推荐理由:Gemini 4 Argon 的发布信息给出了输出上限、定价与多项基准成绩,可据此判断前沿模型在长程工程与安全防御上的进展。
Claude Sonnet 5.5 现已在 Google Cloud 上线,面向编程与知识工作场景。官方称其能以更低单任务成本、更快速度帮助构建功能并产出规范的工作材料。
Google 与 XPRIZE、Range Media Partners 合办的 Future Vision XPRIZE 在洛杉矶揭晓,独立电影人 Jeff Synthesized 凭《The Gifted》从全球 2500 多件参赛作品中获得大奖。
Gleb Otochkin 在 AlloyDB Omni 上用 3 万行商品数据和 vector(768) 嵌入,实测语义搜索、过滤查询和多表 join 三类场景下向量与业务数据同表存储与独立嵌入表加主键 join 的性能差异。
Google Research 提出基于 Gemini 和 Veo 的多智能体编排框架,将长视频生成建模为全局优化与世界状态跟踪问题,包含 Co-Director(COLM 2026)、CANVAS(EMNLP 2026)、A²RD 和 VQQA 四个框架,支持 SynthID 水印。
Google Cloud API Gateway 在 Public Preview 中可充当远程 MCP 服务器,无需单独搭建 MCP 服务器,即可把已有 REST API 暴露为智能体可调用的工具。
推荐理由:原文说明了通过注解 OpenAPI 规格让网关直接充当远程 MCP 服务器的做法,并给出配置示例、安全注意事项和当前限制。
Google 团队用 MaxText 在 Google Cloud TPU 上从头复现 Ai2 的 Olmo 3 7B,完成 stage-1 预训练(约5.93T token。
NVIDIA 与 Google DeepMind、EMBL-EBI 等全球研究机构合作,通过 AlphaFold Database 开放发布 2800 多种病毒的蛋白复合物预测 3D 结构,旨在为下一次疫情储备知识。
推荐理由:原文给出数据集规模、覆盖范围和可复用的开源预测流程,读者可以据此评估如何用于自己的蛋白结构研究。
Google Cloud 推出 AlloyDB 新的智能体数据库架构并开放 AlloyDB PostgreSQL for agents 预览,通过 MCP 接入独立 microVM 代理节点池,直接读取 Colossus 存储实现与生产集群物理隔离。
Remedy Entertainment 的《CONTROL Resonant》本周在 GeForce NOW 首发上线,Ultimate 会员可以 GeForce RTX 5080 级性能串流游玩,支持 DLSS 4、光线追踪与最高 5K HDR,无需 100GB 本地安装。
Google 宣布 Antigravity SDK 支持本地工作流,首发支持通过 Google AI Edge 的 LiteRT 运行 Gemma 4 26B A4B,可完全离线获得智能体辅助能力,建议机器配备超过 24GB VRAM 或统一内存。
推荐理由:官方给出完整的本地模型接入步骤和混合编排示例,开发者可以直接照此把智能体工作流搬到离线环境。
Google DeepMind 宣布将为 Private AI Compute 平台引入私密的服务端持久记忆,使 AI 助手能跨设备长期保留上下文。数据密封在云端专用加密存储中,解密密钥仅保存在用户设备上,请求通过端到端加密通道在隔离的安全飞区中临时解密处理,即使 Google 也无法访问。
谷歌将实时视频形象加入 Gemini 3.8 Live,企业可构建带口型、表情和语音同步的对话角色,并在后台调用工具。服务支持多语言和预设形象;从参考图片定制形象需要企业白名单,音视频输出带有 SynthID 水印。
推荐理由:实时形象与工具调用结合,让企业对话界面可以表达表情和口型,公开的准入条件便于评估实际接入范围。
Google DeepMind 发布 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款文本转语音模型,支持用自然语言提示词从零设计声音、30 秒样本复刻声音,并提供逐行表演指导、长时音频生成和双说话人场景编排,覆盖 100 多种语言。
推荐理由:官方介绍了两款 TTS 模型的能力细节、评测名次和开放入口,开发者可以据此评估语音生成工作流的选型。
Google 发布 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两个文生语音模型,支持预设音色和声音复刻。
Google 宣布 Google AI 订阅用户即日起可获 Colab 高级权益,包括优先使用更快的加速器和更强的机型。Google AI Ultra 订阅还解锁后台不间断执行和 Premium GPU,长训练任务无需保持浏览器标签页打开,权益将在未来几周内向 Colab 支持国家/地区的订阅用户推出,原 Colab 订阅不受影响且可与 Google AI 订阅权益叠加。
Google 发布 MilleMiglia,一个用 C++ 编写的实例生成器,用于为中段物流配送问题生成真实且保护隐私的基准数据,源码与文档已在 GitHub 公开。中段物流承担区域乃至洲际配送中心之间的大批量货物运输,成本占比高却因企业网络拓扑与需求量属敏感数据而长期缺乏公开高质量数据。该生成器将中段物流建模为时空图上的多商品流问题,以刻画货物在多个车辆间转运、需在时间窗内赶上接驳车辆等约束。
OpenRouter 对其路由的 20 个图像生成模型用相同提示词实测计费,单张图片成本在 $0.006 到 $0.134 之间,相差 22 倍。
推荐理由:OpenRouter 用同一提示词实测 20 个图像生成模型的真实计费,读者可以借此绕开各不相同的计价单位直接比较成本。
Google Research 发布新研究实验,让教育者用针对学习优化的生成式用户界面(GenUI)动态生成符合其教学目标的互动学习模拟。
Google 与 Speakeasy 合作,将 Speakeasy 的 OpenAPI 客户端代码生成套件以 AGPLv3 许可开源,此前原 SDK 生成供应商被收购并突然宣布关停,凸显闭源生成器的平台风险。
推荐理由:原文交代了开源 SDK 生成器的许可、语言覆盖和迁移背景,开发者可据此评估能否替代自有闭源生成管线。
Google 在 Gemini Enterprise Agent Platform 上以 Private Preview 推出 Agent Anomaly Detection,这是一个基于推理的智能体行为审计层,读取智能体的日志和 OpenTelemetry 轨迹,标记行为异常、可疑意图和策略违规。
Google 在 Gemini API 和 Google AI Studio 发布 Gemini 3.8 Live 与 3.8 Live Extended Thinking 语音模型,支持异步函数调用、视觉上下文、97+ 语言和可配置思考,Extended Thinking 版位列 Artificial Analysis 语音到语音榜单第一。
Google Research 提出 Retrieve-for-Train 框架,用离线强化学习将奖励对齐的查询扇出编译为监督信号,再蒸馏进一个 53.9M 参数的扩散检索器,实现推理时单次非自回归生成完整结果集,无需测试时 CoT 推理 token。该方法基于 Gemma3-4B 和 Qwen3-4B 微调,旨在解决零样本 LLM 的复述坍缩与自回归延迟瓶颈,论文已被 ICML 2026 收录。
Google DeepMind 发布 Gemini 3.8 Live 与 Gemini 3.8 Live Extended Thinking 两个近实时语音对话模型,主打语音智能体和复杂任务执行。
推荐理由:原文给出两个语音对话模型的定位分工和多项基准数字,读者可以据此评估其推理、成本与工具调用能力。
Google AI 发布迄今最先进的 Gemini 音频模型 Gemini 3.8 Live 与 3.8 Live Extended Thinking。
Google 开发者博客发布零信任智能体系列第二部分,把安全检查从构建期移到 Gemini Enterprise Agent Platform 运行时,用 Model Armor、Semantic Governance Policies 和 Agent Anomaly Detection 三项托管控制拦截构建期规则放过的攻击。
Google 宣布其语言技术已支持超过 300 种语言、覆盖全球 86% 人口,并发布 TranslateGemma 轻量开源翻译模型(基于 Gemini 训练、支持 55 种语言、可离线运行)。
推荐理由:原文来自 Google 对其语言技术的系统性梳理,读者可以借此了解其多语言 AI 的技术路线和数据合作方式。
Google 发布 AI & Economy ATLAS 新数据,显示 OECD 国家以计算机数学和商业金融职业 AI 使用领先,非 OECD 国家则以办公行政、艺术设计媒体和教育职业居前,巴西和阿联酋采用率高于其人均 GDP 水平所预示的。
Apple 发布新一代 Apple Intelligence,推出全面重构的 Siri AI,支持个人语境理解、屏幕感知、系统级应用操作和跨设备对话,今日起以英文测试版随 2027 系统更新推出,下月扩展至法语、日语、韩语、葡萄牙语和西班牙语。
推荐理由:官方公告完整列出 Siri AI 的能力清单、设备与语言范围,以及欧盟和中国市场暂不可用等限制,读者可据此评估适用性。
Google 发布 autofinetune 项目,把 autoresearch 的自主研究循环应用到 LLM 后训练(SFT 和 GRPO),使用 Tunix、Gemma、Cloud TPU,由 Antigravity CLI 和 Gemini Flash 3.7 编排。
Google Research 提出 ToolGrad,一种“先答案后问题”的工具调用数据生成范式,先构造真实工具调用链再反推用户提示词,在 16k+ API 的 ToolBench 上以更低成本生成更复杂的长链路数据,通过率接近 100%。
Google AI 的 Tilde A. Thurium 发布访谈视频,请 Annie Wang 从头讲解图工程(graph engineering),以及它如何让开发者掌控复杂 AI 系统。
Gemini 应用现已支持 Windows。用户按 Alt + Space 即可在常用工具旁唤起 Gemini,用于润色草稿、总结长文档、头脑风暴以及生成自定义图片和视频。