Gemini 3.8 Flash 发布,网络安全版本限定防御团队使用
谷歌推出 Gemini 3.8 Flash,升级编码、推理和长程智能体任务,并接入开发平台及部分付费消费入口。另一个 Flash Cyber 版本只向获准的防御团队开放;普通版本的优惠价格有截止日期,更高推理强度也可能增加用量。
推荐理由:通用版本与安全专用版本采用不同开放范围,团队可以同时比较日常任务能力、推理成本和受控访问条件。
AI 写代码的一切:编码助手、Vibe Coding、代码模型评测与开发工作流变革。
谷歌推出 Gemini 3.8 Flash,升级编码、推理和长程智能体任务,并接入开发平台及部分付费消费入口。另一个 Flash Cyber 版本只向获准的防御团队开放;普通版本的优惠价格有截止日期,更高推理强度也可能增加用量。
推荐理由:通用版本与安全专用版本采用不同开放范围,团队可以同时比较日常任务能力、推理成本和受控访问条件。
Epoch AI 对 SWE-Bench Pro 的基准评审判定其为 Flawed,认为很可能超过 20% 的任务存在评分缺陷。
推荐理由:Epoch AI 汇总多方审计数据并给出 Flawed 判定,读者可据此决定是否还把 SWE-Bench Pro 当作可信的编码评测依据。
Google DeepMind 发布 Gemini 3.7 Flash,定位为面向编码与智能体的最强主力模型,距 Gemini 3.6 Flash 发布仅三周。
推荐理由:官方给出与 3.6 Flash 的多项基准对比和半价定价,可据此判断编码与智能体场景的成本变化。
微软研究院发布开源框架 Orchard,核心是 Kubernetes 环境服务 Orchard Env,可复用于软件工程、网页导航和个人助理三类智能体任务,并支持直接在 Codex、OpenClaw、ZeroClaw 等真实部署 harness 中训练。
推荐理由:微软研究院开源 Orchard 框架,公开环境服务、训练流程与数据,读者可据此了解小模型在真实 harness 中训练智能体的可行路径。
Google DeepMind 发布 Gemini 3.5 Flash Cyber,这是基于 3.5 Flash 微调的轻量网络安全模型,用于快速发现、验证和修补漏洞,在 CyberGym 等基准上以多次调用取得接近更大模型的成绩。
推荐理由:Google 把轻量 Flash 微调成专用安全模型,并给出 CyberGym 与 Chrome 流水线的实测对比,可看专用小模型在漏洞挖掘上的取舍。
Google DeepMind 发布 Gemini 3.5 系列首个模型 3.5 Flash,定位面向智能体与编码的前沿性能,即日起通过 Gemini app、Google Search 的 AI Mode、Google Antigravity、Gemini API、Android Studio 及 Gemini Enterprise 等渠道开放。
推荐理由:Gemini 3.5 Flash 的基准成绩、速度与开放渠道一并给出,可据此判断智能体与编码任务的成本变化。
Google DeepMind 发布 AlphaEvolve 一年进展汇总,这款由 Gemini 驱动的编码智能体已从试点进入 Google 基础设施核心,用于优化下一代 TPU 设计、发现更高效的缓存替换策略,并将 Spanner 的写放大降低 20%。
推荐理由:官方汇总 AlphaEvolve 一年落地案例,含 TPU 电路、Spanner 与多家企业优化数据,可看编码智能体的实际边界。