ATV Big Air Tour 用 ChatGPT Work 把 3 天工作量压缩到 3 小时
ATV Big Air Tour 两名联合创始人用 ChatGPT Work 运营全美 26 场巡演,把商品盘点和补货从 2-3 天缩短到 2-3 小时。每日自动简报将活动信息核查从每周约 8 小时降到 1 小时,自动查找错误并起草更正邮件。AEO 自动化审计网站结构后,OpenAI 搜索和用户爬虫访问量在连续 30 天周期内从 183 增至 2,421,环比增长 1,223%。
ATV Big Air Tour 两名联合创始人用 ChatGPT Work 运营全美 26 场巡演,把商品盘点和补货从 2-3 天缩短到 2-3 小时。每日自动简报将活动信息核查从每周约 8 小时降到 1 小时,自动查找错误并起草更正邮件。AEO 自动化审计网站结构后,OpenAI 搜索和用户爬虫访问量在连续 30 天周期内从 183 增至 2,421,环比增长 1,223%。
Meta 发布技术博客,介绍其为合规领域构建的 AI Agent,用结构化知识系统加可组合 recipes 复现专家推理方式,专家反馈经诊断、编译、验证和人工审核后写入 200+ 知识文件,无需重新训练模型。六周三轮开发后,单项评估时间从数天缩短到数分钟,改进周期内零回归,每轮修复自动加入回归测试集。
GitHub Podcast 一期节目配套文章由 Cassidy Williams 与 Marlene Mhangami 等解读当下 AI 开发常见新术语。
Claude 官方频道发布视频,介绍 Claude Code 团队自己如何使用 Claude Code。材料仅含标题,无正文文本,具体内容细节以视频为准。
GitHub 工程师 Erik Kristensen 分享了 Copilot 降本的四项改动:选择性压缩工具输出、移除 view 工具行号前缀(线下推理成本降约 5%,线上用户日均推理成本降约 3%)、压缩 task-tool 提示词(每轮省约 1300 token,每活跃小时归一化成本降 2.9%)、后台任务完成后直接交付结果(AI Credits 用量降约 2.3%)。
推荐理由:GitHub 用四项改动说明压缩 token 为何要看整个任务而非单次调用,并给出可复用的评估方法与踩坑教训。
Anthropic 发布构建电商智能体的指南,总结架构、延迟与成本优化、生产运维三部分实践,涉及购物和商家两类智能体,企业客户部署后出现购物车变大和卖家运营效率提升。核心建议包括用单个智能体加技能而非子智能体、将 UI 组件做成工具、用提示词缓存实现 90-99% 命中率、在 harness 中强制安全规则,并开源参考实现 anthropics/commerce-agents。
推荐理由:Anthropic 根据多个企业部署经验总结电商智能体架构、延迟成本优化和生产实践,并附参考实现,可迁移到类似 Agent 项目。
Google AI 团队发布教程,讲解如何为 LLM-as-a-Judge 评测编写可靠的布尔式评分标准,指出模糊提示会导致评估不一致和浪费 token。文中给出四条经验:问题保持原子化且互不重叠、只让评判模型评估客观事实(可用 RFC 2119 术语如 MUST 表述)、只评 prompt 中明确要求的内容、用专家标注的 golden set 校准评判模型直至与人类评分一致。
推荐理由:作者来自 Google 团队,把写作 LLM-as-a-judge 评分标准的经验整理成四条可迁移规则,附带校准流程,适合自己搭建评测时参考。
Google for Startups AI Agents Challenge 评审团队从各赛道头部参赛作品中提炼出 4 种共同工程模式。
推荐理由:从获奖参赛代码中提炼出四个可直接套用的工程模式,涵盖 MCP 双向暴露、事件驱动并发、回退校验和分层路由。
Google 员工 Shir Meir Lador 介绍 harness 工程,即用确定性组件包裹 LLM,包括编排层、执行沙箱、状态持久化和验证工具,让 Agent 不需逐行人工审查即可安全生成代码。
推荐理由:原文解释了 harness 工程的构成要素,并给出可运行的沙箱与修复循环示例代码,方法可直接迁移到自己的 Agent 工作流。
Baseten 发文解析开源模型后训练的成本驱动因素,指出活跃参数量是 RL 后训练成本的最大来源,总参数和 KV cache 主要限制推理速度,并按成本档位推荐 DeepSeek-V4-Flash、GLM-5.2、Kimi K2.6、Kimi K2.7 Code、Nemotron-3-Super-120B 和 Qwen3 系列。选型建议关注库支持、基准表现和后训练循环成本三方面。
推荐理由:原文把后训练成本拆解为活跃参数、总参数和 KV cache 三个因素,并按成本档位比较了多款开源模型,方法可直接迁移到选型。
8月12日西班牙出现欧洲大陆27年来首次日全食,全食持续101秒,天体物理学博士刘博洋在日食结束后不到3小时产出了高清日冕精细结构图。他此前把Druckmüller的五篇论文交给千问「工作助理」分析核心思路,悟出大师方法的本质是模拟人眼的局部差分视觉,并用过去日冕素材迭代100多个版本复现了整套算法。观测现场他还用千问根据低仰角与高仰角曝光数据推算补偿档数、写脚本测试新快门线的参数组合效率。
可灵 Kling AI 发布教程,讲解如何在 Kling MCP 中使用 Elements 功能,在不同镜头间保持角色身份一致,从而创作更连贯的 AI 生成故事。
Databricks 官方博客发布 Big Book of AgentOps,将 AgentOps 定义为构建、部署和运营智能体的操作规范,面向 AI 智能体的工程实践。
澳大利亚律所 Gilbert + Tobin 通过 ChatGPT Enterprise 和 Codex 将 AI 融入运营,截至 2026 年 6 月 87% 的启用席位处于活跃使用状态,是其其他工具采用率的两倍以上。
FDA 在 Databricks for Government 上构建安全、AI 就绪的数据基础,原文将联邦数据平台现代化比作在航行中重建航母引擎,正文仅给出这一背景性描述。
Databricks 工程团队分享如何在一小时内消除每年 100 万美元的 AI 智能体浪费支出。工程师团队高度依赖 AI 智能体来简化和加速工作,由此产生了相应的使用开销。
Claude 官方频道发布视频,主题为与客户一起构建企业级前沿安全防护(Enterprise Frontier Safeguards)。原文无正文文本,仅提供标题和视频链接 https://www.youtube.com/watch?v=FoteuzPpx7E 。
Claude 官方频道发布视频,展示用 Claude 编写代码构建一个水彩引擎。正文无文字内容,细节以视频为准。
Claude 官方发布视频,演示用 Claude Fable 5.1 进行全栈调试。视频无正文文本,更多细节以原视频内容为准。
这篇是 Google 团队 Elevating Antigravity Agent Skills 五部曲的第二部分,讲解如何在 agent skill 中使用 generate_image 工具,把结构化提示词合成与原生图像生成结合,让 agent 产出符合开发者规范的图像。
OpenAI 发布文章,介绍 Basis、Clay 和 Exa Labs 用 Agent 承接员工入职、账户管理和开发者集成的工作流。Basis 把入职从 2 小时缩短到 30 分钟,Clay 的子智能体每天夜间更新各账户上下文,为销售省下约 1 小时邮件分拣,Exa 用 Codex 监控集成机会并创建 PR、跑测试。文章还给出企业从试点到规模化的六步方法。
Google Developer Relations 团队的 Jan-Felix Schmakeit 介绍为 Google 产品的 Agent Skills 设计评测的方法,主张像写单元测试一样建立结构化、自动化的评测流程,而非在终端做 vibe testing。
Replit 官方发布直播预告,主题为在 Replit 中构建一个个性化邮件助手,直播深度解析链接为 https://x.com/i/broadcasts/1oKMvNLkEjpGQ。
OpenRouter 官方分享一条使用技巧:可在其基准浏览器(benchmark explorer)中浏览图像模型,并在 Agent 或 Chatroom 中快速编辑提示词。
Tessl 设计师复盘在 agent 软件工厂 Kikimora 中把品牌与设计规则编入 AI 工作流的方法,指出设计系统只提供组件、教不会构图。
推荐理由:作者给出从 Figma diff 反推设计规则、再以技能和全量扫描落地的可复用路径,可迁移到任何用 agent 生产界面的团队。
Databricks 发布博客,讲解如何在数据栈中落地 Genie Ontology,为 AI 智能体构建超越语义模型的共享业务上下文。
可灵(Kling AI)发布官方教程,讲解如何使用 Kling MCP 中的 Elements 功能在不同镜头之间保持角色身份一致,从而创作更具连贯性的 AI 生成故事。
Discovery Bank 通过行为 AI、治理化数据和实时决策,在满足规模、速度与安全要求的同时让每个客户交互都具备个性化体验。文章介绍了该银行实现大规模超个性化银行服务的具体方法。
小红书与NVIDIA联合构建GR-Inference,一个面向长Context、短Decode、大Beam的生成式召回专用推理引擎,覆盖KV抽象、连续批处理、专用Decode Attention、受限生成与CUDA Graph等优化。
Google AI 的 AI Evals 系列第三篇介绍用 tocsv.py 脚本通过 pandas 把 Inspect AI 评测日志转换为适合 Google Sheets 的 CSV。
vLLM-Omni 团队发布 MiniMax H3 生产级服务实践,先做系统级优化,再集成 FastVideo 的四步 FastH3 蒸馏学生模型,将去噪循环从 49 次 DiT 前向降到 4 次。
OpenClaw 官方发推提示用户可以将 Google DeepMind 的 Flash 3.7 接入 OpenClaw 使用,并引用了 @_philschmid 的一篇文章作为说明来源。
NVIDIA 技术博客发布一套 AI 推理 GPU 规模规划框架,围绕用例、token 模式、TTFT 等延迟指标、并发、缓存命中率、模型选择和部署策略给出 sizing 方法,并提出 core-and-flex 容量策略平衡 capex 与 opex。