跳到正文

#教程/实践

今日 3 条
9月3日周四
  1. OpenAI:官网动态(RSS · 排除企业/客户案例)38

    ATV Big Air Tour 用 ChatGPT Work 把 3 天工作量压缩到 3 小时

    ATV Big Air Tour 两名联合创始人用 ChatGPT Work 运营全美 26 场巡演,把商品盘点和补货从 2-3 天缩短到 2-3 小时。每日自动简报将活动信息核查从每周约 8 小时降到 1 小时,自动查找错误并起草更正邮件。AEO 自动化审计网站结构后,OpenAI 搜索和用户爬虫访问量在连续 30 天周期内从 183 增至 2,421,环比增长 1,223%。

  2. Meta Engineering Blog(RSS)53

    Meta 构建“组织第二大脑”AI Agent,从专家反馈中沉淀机构知识

    Meta 发布技术博客,介绍其为合规领域构建的 AI Agent,用结构化知识系统加可组合 recipes 复现专家推理方式,专家反馈经诊断、编译、验证和人工审核后写入 200+ 知识文件,无需重新训练模型。六周三轮开发后,单项评估时间从数天缩短到数分钟,改进周期内零回归,每轮修复自动加入回归测试集。

  3. GitHub Blog62

    GitHub Copilot 如何在不牺牲任务质量的前提下降低 AI 编码成本

    GitHub 工程师 Erik Kristensen 分享了 Copilot 降本的四项改动:选择性压缩工具输出、移除 view 工具行号前缀(线下推理成本降约 5%,线上用户日均推理成本降约 3%)、压缩 task-tool 提示词(每轮省约 1300 token,每活跃小时归一化成本降 2.9%)、后台任务完成后直接交付结果(AI Credits 用量降约 2.3%)。

    推荐理由:GitHub 用四项改动说明压缩 token 为何要看整个任务而非单次调用,并给出可复用的评估方法与踩坑教训。

  4. Claude:Blog(网页)79

    Anthropic 发布 Claude 电商智能体构建指南及参考实现

    Anthropic 发布构建电商智能体的指南,总结架构、延迟与成本优化、生产运维三部分实践,涉及购物和商家两类智能体,企业客户部署后出现购物车变大和卖家运营效率提升。核心建议包括用单个智能体加技能而非子智能体、将 UI 组件做成工具、用提示词缓存实现 90-99% 命中率、在 harness 中强制安全规则,并开源参考实现 anthropics/commerce-agents。

    推荐理由:Anthropic 根据多个企业部署经验总结电商智能体架构、延迟成本优化和生产实践,并附参考实现,可迁移到类似 Agent 项目。

  5. Google AI:DEV 作者专属(RSS)66

    Google AI 团队分享如何为 LLM-as-a-Judge 评测编写可靠的评分标准

    Google AI 团队发布教程,讲解如何为 LLM-as-a-Judge 评测编写可靠的布尔式评分标准,指出模糊提示会导致评估不一致和浪费 token。文中给出四条经验:问题保持原子化且互不重叠、只让评判模型评估客观事实(可用 RFC 2119 术语如 MUST 表述)、只评 prompt 中明确要求的内容、用专家标注的 golden set 校准评判模型直至与人类评分一致。

    推荐理由:作者来自 Google 团队,把写作 LLM-as-a-judge 评分标准的经验整理成四条可迁移规则,附带校准流程,适合自己搭建评测时参考。

9月2日周三
  1. Google AI:DEV 作者专属(RSS)69

    什么是 harness 工程?Google 用 ADK 2.0 与 Antigravity SDK 演示自动修复编码循环

    Google 员工 Shir Meir Lador 介绍 harness 工程,即用确定性组件包裹 LLM,包括编排层、执行沙箱、状态持久化和验证工具,让 Agent 不需逐行人工审查即可安全生成代码。

    推荐理由:原文解释了 harness 工程的构成要素,并给出可运行的沙箱与修复循环示例代码,方法可直接迁移到自己的 Agent 工作流。

  2. Baseten 工程博客(网页)62

    Baseten 解析后训练最佳开源模型并按成本分档推荐

    Baseten 发文解析开源模型后训练的成本驱动因素,指出活跃参数量是 RL 后训练成本的最大来源,总参数和 KV cache 主要限制推理速度,并按成本档位推荐 DeepSeek-V4-Flash、GLM-5.2、Kimi K2.6、Kimi K2.7 Code、Nemotron-3-Super-120B 和 Qwen3 系列。选型建议关注库支持、基准表现和后训练循环成本三方面。

    推荐理由:原文把后训练成本拆解为活跃参数、总参数和 KV cache 三个因素,并按成本档位比较了多款开源模型,方法可直接迁移到选型。

  3. 公众号:千问APP(阿里)41

    天体物理学博士刘博洋用千问复现Druckmüller算法,日全食后3小时产出高清日冕图

    8月12日西班牙出现欧洲大陆27年来首次日全食,全食持续101秒,天体物理学博士刘博洋在日食结束后不到3小时产出了高清日冕精细结构图。他此前把Druckmüller的五篇论文交给千问「工作助理」分析核心思路,悟出大师方法的本质是模拟人眼的局部差分视觉,并用过去日冕素材迭代100多个版本复现了整套算法。观测现场他还用千问根据低仰角与高仰角曝光数据推算补偿档数、写脚本测试新快门线的参数组合效率。

  4. OpenAI:官网动态(RSS · 排除企业/客户案例)46

    OpenAI 解析 Basis、Clay、Exa 如何把工作流变成 AI 原生运营能力

    OpenAI 发布文章,介绍 Basis、Clay 和 Exa Labs 用 Agent 承接员工入职、账户管理和开发者集成的工作流。Basis 把入职从 2 小时缩短到 30 分钟,Clay 的子智能体每天夜间更新各账户上下文,为销售省下约 1 小时邮件分拣,Exa 用 Codex 监控集成机会并创建 PR、跑测试。文章还给出企业从试点到规模化的六步方法。

  5. Tessl:产品与工程博客66

    Tessl 设计师总结如何把设计判断教给 AI 智能体

    Tessl 设计师复盘在 agent 软件工厂 Kikimora 中把品牌与设计规则编入 AI 工作流的方法,指出设计系统只提供组件、教不会构图。

    推荐理由:作者给出从 Figma diff 反推设计规则、再以技能和全量扫描落地的可复用路径,可迁移到任何用 agent 生产界面的团队。

9月1日周二