Reflection 发布首款开源权重模型 Beam,主打低算力对标 DeepSeek 与 Qwen
AI 公司 Reflection 发布首款免费开放模型 Beam,采用 MoE 架构,每 token 激活 5010 亿总参数中的 230 亿,面向编码、逻辑推理和智能体任务。
推荐理由:Reflection 首款开源权重模型 Beam 以 MoE 架构和超大规模 RL 训练,在推理与编码基准上以更少算力对标 GLM 5.2 和 Qwen 3.8。
AI 公司 Reflection 发布首款免费开放模型 Beam,采用 MoE 架构,每 token 激活 5010 亿总参数中的 230 亿,面向编码、逻辑推理和智能体任务。
推荐理由:Reflection 首款开源权重模型 Beam 以 MoE 架构和超大规模 RL 训练,在推理与编码基准上以更少算力对标 GLM 5.2 和 Qwen 3.8。
Reflection 发布 Beam,一个面向编码、智能体与科研任务的纯文本 MoE 模型,总参数 501B、激活 23B,从零训练,Apache 2.0 全量权重将于本月放出。
Z.ai(智谱 AI)的 GLM 5.3 已在 Amazon Bedrock 上线,这是一个 753B 参数的 MoE 模型,面向编码和长周期智能体任务。Bedrock 提供全托管 API、跨区域推理、提示词缓存和服务层级,支持 OpenAI 兼容的 Responses 与 Chat Completions API 以及 Invoke 和 Converse API。
推荐理由:GLM 5.3 在 Bedrock 上线,读者可了解其 753B MoE 规格、编码与安全能力及托管接入方式。
Reflection AI 发布首款前沿开源权重模型 Beam,称其在高级推理基准上追平 Z.ai 的 GLM-5.2,并比当前领先的西方开源模型表现更好,推理算力用量少 3-4 倍。
HackerRank 将其 AI 面试官 Chakra 面向客户正式开放,此前约六个月的测试中已完成超过 50 万场面试,Snowflake、Snorkel、Capgemini 等公司参与试用。
GitHub 发布 ReviewBench,一个面向 AI 代码审查智能体的开放离线基准,基于 1.039 亿个 GitHub PR 的分布特征构建,包含来自 187 个开源仓库、覆盖 19 种语言的 219 个 PR。
推荐理由:GitHub 公开了代码审查基准的构建方法与评分口径,读者可据此理解 AI 代码审查评测如何贴近真实 PR 分布。
研究团队提出 Image-to-Code 方法,让编码智能体从单张照片写出可执行的 Blender 程序,并迭代修改直到场景匹配原图。配套基准 LEGO-Bench 包含 104 个场景的 208 张图像,最佳模型 GPT-6 Astra 在室内场景准确率 53.4%、室外仅 39.6%,弱配置约 15%。
Anthropic 为 Claude Code 发布 Mods,一套运行在工具内部的插件式中间件,开发者可用 JavaScript 或 TypeScript 函数挂钩工具调用、用户提示词和 UI 渲染等事件,从而修改 Claude Code 的外观与行为。
Chatham Financial 使用 OpenAI 的 Codex 和 GPT-5.6 构建技术并重新设计工作流程,将交易验证时间从 30 分钟缩短到 4 分钟以内。
GitHub 提出 AI 时代开发者需要强化的三项技能:学会指挥 AI 而非只是使用它、不要轻信 AI 的第一个答案、用 AI 省下的时间解决更大的问题。文章以添加认证流程为例,说明开发者角色正从逐行实现转向定义问题、审查 AI 输出并做技术决策;并提到 GitHub Copilot 内置的 Rubber Duck agent 会用第二个模型对计划、代码和测试进行评审。
Airbnb CTO Ahmad Al-Dahle 披露公司 AI 转型进展:目前 60% 的代码由 AI 编写,功能交付量同比增长近 80%,工程师人均 PR 吞吐量提升约 1.6 倍,约一半客服工单已完全由 AI 解决。
Google 母公司 Alphabet 发布 Gemini 4 Argon,称其可处理编码、研究和写作等任务,并专门针对防御性网络安全训练,能自主发现、验证和修补关键软件漏洞。
Shopify 发布建站工具 Canvas,商家通过与 AI 智能体 Sidekick 对话即可搭建店铺。Canvas 实时渲染店铺真实代码而非静态预览,可测试页面交互与动画,并查看不同屏幕尺寸下的效果;Sidekick 会截图以同步商家所见。该产品初期不支持第三方主题、应用区块与扩展、多市场、翻译、灰度发布和主题更新,且仅限桌面端,Shopify 表示后续会逐步支持。
Google DeepMind 发布前沿模型 Gemini 4 Argon,先通过 Fairwind Program 向受信任的网络安全防御方开放,随后逐步扩展至开发者、企业和消费者。
推荐理由:Gemini 4 Argon 的发布信息给出了输出上限、定价与多项基准成绩,可据此判断前沿模型在长程工程与安全防御上的进展。
Simon Willison 用 Claude Opus 5.5 改进其纯 Python WebAssembly 引擎 pwasm,42 次提交后已支持几乎全部 WASM 规范,PyPI wheel 内置 MicroPython、QuickJS 和 Micro QuickJS 的可用 WASM 构建。该项目最初于今年 1 月由 AI 生成,作者以 alpha 版本发布,提醒不要信任其稳定性。
GPT-6.1 Sol 现已在 Amazon Bedrock 正式可用,面向智能体编码、计算机使用和专业工作负载提供更强推理能力。据 OpenAI,它在 DeepSWE v1.1 上以约五分之一的单任务成本达到 GPT-6 Astra 的水平,并比 GPT-6 Sol 最佳成绩高 6.4 个百分点,且推理投入更低。
推荐理由:AWS 官方给出 GPT-6.1 Sol 在 Bedrock 上的能力定位与成本对比,可据此判断智能体工作流的落地方式。
Shopify 宣布原生开发是其移动开发的未来,Shop 应用已在 12 周内用 AI 重写为完全原生的 Swift 和 Kotlin 应用,其余应用将陆续迁移。
推荐理由:文章梳理了 Shopify 从 React Native 转回原生的决策过程,核心变化是 AI 智能体降低了跨平台共享代码的优势。
Simon Willison 在旧金山 Fort Mason 现场直播 OpenAI DevDay 2026 主题演讲,OpenAI 发布个人智能体产品 Dots。
推荐理由:现场逐条记录 OpenAI DevDay 2026 的发布节奏与演示翻车细节,可对照官方口径看实际落地情况。
面向编程智能体的新技能:openrouter-decisions 将你的智能体指向一个分类、路由或审核步骤,它就能通过 OpenRouter 的 Decisions API 在决策模型上重建该步骤。
小红书 AllSpark 团队提出 PACT(Policy Aligned Critic Training),通过三个正则条件唯一确定长程 Agent 的信用分配,并用 BCE 回归有界 Value、采用 Actor-Then-Critic 更新顺序改进 Critic 与策略对齐。
作者实测 Anthropic 新发布的 Claude Sonnet 5.5,用代码动画、HTML PPT、3D 网页和写作四项任务对比 Opus 5.5 与 gpt6。
OpenAI DevDay 2026 公布 20 多项发布,涵盖 GPT-6 Astra、ChatGPT、Codex、API、安全以及面向开发者的新工具。
OpenAI 发布 GPT-6.1 Sol,官方称其在编码、电脑操作和专业工作方面接近 Astra 的智能水平。该模型标准 API 输入与输出 token 价格均为 Astra 的五分之一。
推荐理由:OpenAI 发布 GPT-6.1 Sol,主打编码与电脑操作能力,API 价格降至 Astra 的五分之一。
零跑汽车与火山引擎合作,将 TRAE 嵌入其全域自研体系,在本地安全网络、车规级工程约束和多团队协同环境中落地 AI Coding。TRAE 采用企业专属域名与网络配置接入受限网络,明确代码仅用于当次推理、不用于模型训练,并通过 Spec/Plan、Rules、Skills 约束 Agent 行为。TRAE 企业版还提供可视化数据看板与灵活模型资源管理,支持按团队设置模型权限和用量配额。
Anthropic 发布 Claude Sonnet 5.5,是 Claude 5.5 家族第二款模型,定位为 Opus 5.5 更快更省的补充,已在 Claude Platform、AWS、Google Cloud 和 Azure 上线。
研究者提出 Physical Coding,将任务状态与执行表示为代码,并构建 HexaAnything 调用感知、规划与控制工具(含 VLA/WAM 策略),依据外部反馈在环决策。
Latent Space 播客邀请 Anthropic 的 Thariq Shihipar 深入讨论 Claude Code 的现状与未来,涵盖 Ask User Question、artifacts、Claude Tag、Projects 和新推出的 Claude Mods 系统。
卡兹克宣布将月活百万的AI热点资讯网站AIHOT正式开源,地址为 https://github.com/KKKKhazix/AIHOT。他在中秋假期用Codex(GPT-6 Astra)和Claude Fable 5.1把旧代码库蒸馏成功能文档与交接包,再由Claude Opus 5.5作为主力重写,2.0版本架构模块化、前端组件化并上线。
Cloudflare 推出开源公测版新 CLI cf,将可覆盖的操作从 Wrangler 的约 280 个扩展到超过 3000 个,覆盖整个 Cloudflare API,安装方式为 npm i -g cf。
Anthropic 发布中端模型 Claude Sonnet 5.5,官方称速度比上一代提升 30%,Token 消耗速度明显更低,定位为编写代码和制作办公文档等日常任务的助手。
Anthropic 发布 Claude Sonnet 5.5,官方称其运行快 30% 以上,多数工作成本最多低 30%,定价与 Sonnet 5 相同但在各项基准上表现更好。
Fireworks AI 发布 FireRouter with Opus,可在 Claude Opus 5.5、GLM 5.3 和 GLM 5.3 Flash 之间做缓存感知路由,并首次以独立路由模型形式作为 serverless 端点开放。
推荐理由:官方给出了内部 A/B 测试的成本与准确率数据,可帮助团队评估用缓存感知路由替代单一 Opus 的可行性。