GitHub 播客解读 AI 开发新术语:loop engineering、Ralph loops、squads、harness 与 hill climbing
GitHub Podcast 一期节目配套文章由 Cassidy Williams 与 Marlene Mhangami 等解读当下 AI 开发常见新术语。
GitHub Podcast 一期节目配套文章由 Cassidy Williams 与 Marlene Mhangami 等解读当下 AI 开发常见新术语。
Claude 官方频道发布视频,介绍 Claude Code 团队自己如何使用 Claude Code。材料仅含标题,无正文文本,具体内容细节以视频为准。
作者对飞书中的「豆包工作」进行一手实测,称工作可以交给豆包工作了。原文信息有限,未给出更多功能或性能细节。
GitHub 工程师 Erik Kristensen 分享了 Copilot 降本的四项改动:选择性压缩工具输出、移除 view 工具行号前缀(线下推理成本降约 5%,线上用户日均推理成本降约 3%)、压缩 task-tool 提示词(每轮省约 1300 token,每活跃小时归一化成本降 2.9%)、后台任务完成后直接交付结果(AI Credits 用量降约 2.3%)。
推荐理由:GitHub 用四项改动说明压缩 token 为何要看整个任务而非单次调用,并给出可复用的评估方法与踩坑教训。
Anthropic 发布构建电商智能体的指南,总结架构、延迟与成本优化、生产运维三部分实践,涉及购物和商家两类智能体,企业客户部署后出现购物车变大和卖家运营效率提升。核心建议包括用单个智能体加技能而非子智能体、将 UI 组件做成工具、用提示词缓存实现 90-99% 命中率、在 harness 中强制安全规则,并开源参考实现 anthropics/commerce-agents。
推荐理由:Anthropic 根据多个企业部署经验总结电商智能体架构、延迟成本优化和生产实践,并附参考实现,可迁移到类似 Agent 项目。
Google AI 团队发布教程,讲解如何为 LLM-as-a-Judge 评测编写可靠的布尔式评分标准,指出模糊提示会导致评估不一致和浪费 token。文中给出四条经验:问题保持原子化且互不重叠、只让评判模型评估客观事实(可用 RFC 2119 术语如 MUST 表述)、只评 prompt 中明确要求的内容、用专家标注的 golden set 校准评判模型直至与人类评分一致。
推荐理由:作者来自 Google 团队,把写作 LLM-as-a-judge 评分标准的经验整理成四条可迁移规则,附带校准流程,适合自己搭建评测时参考。
Google for Startups AI Agents Challenge 评审团队从各赛道头部参赛作品中提炼出 4 种共同工程模式。
推荐理由:从获奖参赛代码中提炼出四个可直接套用的工程模式,涵盖 MCP 双向暴露、事件驱动并发、回退校验和分层路由。
Google 员工 Shir Meir Lador 介绍 harness 工程,即用确定性组件包裹 LLM,包括编排层、执行沙箱、状态持久化和验证工具,让 Agent 不需逐行人工审查即可安全生成代码。
推荐理由:原文解释了 harness 工程的构成要素,并给出可运行的沙箱与修复循环示例代码,方法可直接迁移到自己的 Agent 工作流。
ByteByteGo 发文解析 RAG 系统中嵌入模型的关键作用,指出语言模型再强也无法弥补错误检索,因为嵌入模型决定了哪些文本进入上下文。文章图解了索引与检索两个阶段的工作流程,列举了语义相似但答非所问的多种失败模式,包括否定句、版本差异和数字标识等,并说明更换嵌入模型需要全量重建向量、索引和权限,成本高昂,类似蓝绿部署。
发表于《欧洲营销杂志》的研究发现,在某些情况下不那么像真人的文字聊天机器人反而获得更积极的客户反馈,打字的慢节奏让消费者有时间平复负面情绪。另一项发表于《商业研究杂志》的研究显示,能准确识别消费者愤怒等情绪状态的 AI 客服会带来更高满意度。调查还显示 1031 名澳大利亚受访者中 78% 用过自动化客服,仅 39% 感到满意。
Baseten 发文解析开源模型后训练的成本驱动因素,指出活跃参数量是 RL 后训练成本的最大来源,总参数和 KV cache 主要限制推理速度,并按成本档位推荐 DeepSeek-V4-Flash、GLM-5.2、Kimi K2.6、Kimi K2.7 Code、Nemotron-3-Super-120B 和 Qwen3 系列。选型建议关注库支持、基准表现和后训练循环成本三方面。
推荐理由:原文把后训练成本拆解为活跃参数、总参数和 KV cache 三个因素,并按成本档位比较了多款开源模型,方法可直接迁移到选型。
作者实测 Anthropic 新发布的 Claude Fable 5.1,认为其在长时间 Agent 任务和浏览器自动化上超过 GPT 5.6。
Baseten 工程师 Philip Kiely 撰文解析 LLM 推理的"有效边界"框架,将推理技术分为两类:在延迟与吞吐之间做取舍以命中边界上某一点的技术,以及把整条边界外推、创造整体效率提升的技术。
Arena 平台发布 2026 年第 35 周(8 月 24 日至 8 月 30 日)AI 大模型盲测排行榜。智谱 GLM-5.3-Flash 首次入榜即列代码榜第 7 名(ELO 1535),阿里 Qwen3.8-max-0902 首次入榜以 1691 分登顶前端开发榜,将 Claude-Opus-5-Max 挤到第二。
8月12日西班牙出现欧洲大陆27年来首次日全食,全食持续101秒,天体物理学博士刘博洋在日食结束后不到3小时产出了高清日冕精细结构图。他此前把Druckmüller的五篇论文交给千问「工作助理」分析核心思路,悟出大师方法的本质是模拟人眼的局部差分视觉,并用过去日冕素材迭代100多个版本复现了整套算法。观测现场他还用千问根据低仰角与高仰角曝光数据推算补偿档数、写脚本测试新快门线的参数组合效率。
作者分享在 48GB 内存 M4 Pro Mac mini 上运行本地 LLM 的完整方案,主模型为 Qwen3.6-35B-A3B-OptiQ-4bit(约占用 20GB 内存),轻量模型为 Gemma-4-E4B,推理服务用 oMLX,通过 Tailscale 让 iPhone、MacBook 共用同一后端,并接入 Hermes、Pi、Apollo 和 Raycast。
作者分享一个 AI 视频技巧:先把参考视频转成深度视频,再用深度视频驱动视频生成,可保留动作、运镜、人物站位和空间关系,同时减少原片人脸、服装、背景和画风的干扰。
可灵 Kling AI 发布教程,讲解如何在 Kling MCP 中使用 Elements 功能,在不同镜头间保持角色身份一致,从而创作更连贯的 AI 生成故事。
澳大利亚律所 Gilbert + Tobin 通过 ChatGPT Enterprise 和 Codex 将 AI 融入运营,截至 2026 年 6 月 87% 的启用席位处于活跃使用状态,是其其他工具采用率的两倍以上。
Simon Willison 实测 Claude Fable 5.1 在 pelican 基准上的表现。Anthropic 称该模型在 Terminal-Bench-Science 0.1 上得 52.6%,高于 Fable 5 的 24.7%。
FDA 在 Databricks for Government 上构建安全、AI 就绪的数据基础,原文将联邦数据平台现代化比作在航行中重建航母引擎,正文仅给出这一背景性描述。
Thomas Wolf 转发 @RemiFabreRobot 的视频,用 Microduck 鸭子学走路的过程讲解强化学习(RL),配乐由 @antoinepirrone 制作。
Databricks 工程团队分享如何在一小时内消除每年 100 万美元的 AI 智能体浪费支出。工程师团队高度依赖 AI 智能体来简化和加速工作,由此产生了相应的使用开销。
AI/ML API 用同样的提示词对 Anthropic 的 Fable 5.1 和 OpenAI 的 GPT-5.6 Sol 做了一次成型的 Three.js 测试,5 个独立场景组成私岛豪宅项目。
Satya Nadella 表示 Microsoft 最新威斯康星 AI 数据中心 Fairwater 每年用水量约等于一家本地餐厅,冷却回路一次性注水后可近乎零耗水运行。
Simon Willison 在 ~/.cache 目录中发现 OpenAI Codex 桌面应用(现已更名为 ChatGPT)的 codex-primary-runtime 文件夹占用 1.7GB,内含完整的 Python 和 Node.js 安装,以及 Poppler、git 和 LibreOffice 的原生二进制文件。
Every 发布对 Fable 5.1 的 Vibe Check 评测,标题称 Anthropic 又回来了,正文未提供更多细节。
Claude 官方频道发布视频,主题为与客户一起构建企业级前沿安全防护(Enterprise Frontier Safeguards)。原文无正文文本,仅提供标题和视频链接 https://www.youtube.com/watch?v=FoteuzPpx7E 。
Claude 官方频道发布视频,展示用 Claude 编写代码构建一个水彩引擎。正文无文字内容,细节以视频为准。
Claude 官方频道发布视频,标题为 Claude codes turn-by-turn directions for the Moon,正文无有效文本,具体内容以视频为准。
Claude 官方发布视频,演示用 Claude Fable 5.1 进行全栈调试。视频无正文文本,更多细节以原视频内容为准。
这篇是 Google 团队 Elevating Antigravity Agent Skills 五部曲的第二部分,讲解如何在 agent skill 中使用 generate_image 工具,把结构化提示词合成与原生图像生成结合,让 agent 产出符合开发者规范的图像。