跳到正文

#教程/实践

今日 3 条
9月3日周四
  1. GitHub Blog62

    GitHub Copilot 如何在不牺牲任务质量的前提下降低 AI 编码成本

    GitHub 工程师 Erik Kristensen 分享了 Copilot 降本的四项改动:选择性压缩工具输出、移除 view 工具行号前缀(线下推理成本降约 5%,线上用户日均推理成本降约 3%)、压缩 task-tool 提示词(每轮省约 1300 token,每活跃小时归一化成本降 2.9%)、后台任务完成后直接交付结果(AI Credits 用量降约 2.3%)。

    推荐理由:GitHub 用四项改动说明压缩 token 为何要看整个任务而非单次调用,并给出可复用的评估方法与踩坑教训。

  2. Claude:Blog(网页)79

    Anthropic 发布 Claude 电商智能体构建指南及参考实现

    Anthropic 发布构建电商智能体的指南,总结架构、延迟与成本优化、生产运维三部分实践,涉及购物和商家两类智能体,企业客户部署后出现购物车变大和卖家运营效率提升。核心建议包括用单个智能体加技能而非子智能体、将 UI 组件做成工具、用提示词缓存实现 90-99% 命中率、在 harness 中强制安全规则,并开源参考实现 anthropics/commerce-agents。

    推荐理由:Anthropic 根据多个企业部署经验总结电商智能体架构、延迟成本优化和生产实践,并附参考实现,可迁移到类似 Agent 项目。

  3. Google AI:DEV 作者专属(RSS)66

    Google AI 团队分享如何为 LLM-as-a-Judge 评测编写可靠的评分标准

    Google AI 团队发布教程,讲解如何为 LLM-as-a-Judge 评测编写可靠的布尔式评分标准,指出模糊提示会导致评估不一致和浪费 token。文中给出四条经验:问题保持原子化且互不重叠、只让评判模型评估客观事实(可用 RFC 2119 术语如 MUST 表述)、只评 prompt 中明确要求的内容、用专家标注的 golden set 校准评判模型直至与人类评分一致。

    推荐理由:作者来自 Google 团队,把写作 LLM-as-a-judge 评分标准的经验整理成四条可迁移规则,附带校准流程,适合自己搭建评测时参考。

  4. elvis60

    Elvis Saravia 分享一条经他实测有效的提示词,用于减少 Claude Fable 5.1 的 "claudese" 文风。提示词来自 Claude 官方文档的 writing density 部分,通过定义 mannered prose 反模式来让文风更直接,官方也给出了简短版本 "Please remove all mannered prose.",建议加入用户消息或系统提示词。原文链接:https://platform.claude.com/docs/en/build-with-claude/prompt-engineering/prompting-claude-fable-5-1#writing-density

9月2日周三
  1. Google AI:DEV 作者专属(RSS)69

    什么是 harness 工程?Google 用 ADK 2.0 与 Antigravity SDK 演示自动修复编码循环

    Google 员工 Shir Meir Lador 介绍 harness 工程,即用确定性组件包裹 LLM,包括编排层、执行沙箱、状态持久化和验证工具,让 Agent 不需逐行人工审查即可安全生成代码。

    推荐理由:原文解释了 harness 工程的构成要素,并给出可运行的沙箱与修复循环示例代码,方法可直接迁移到自己的 Agent 工作流。

  2. ByteByteGo(RSS)57

    RAG 系统效果为何取决于嵌入模型:ByteByteGo 图解检索机制与选型要点

    ByteByteGo 发文解析 RAG 系统中嵌入模型的关键作用,指出语言模型再强也无法弥补错误检索,因为嵌入模型决定了哪些文本进入上下文。文章图解了索引与检索两个阶段的工作流程,列举了语义相似但答非所问的多种失败模式,包括否定句、版本差异和数字标识等,并说明更换嵌入模型需要全量重建向量、索引和权限,成本高昂,类似蓝绿部署。

  3. Baseten 工程博客(网页)62

    Baseten 解析后训练最佳开源模型并按成本分档推荐

    Baseten 发文解析开源模型后训练的成本驱动因素,指出活跃参数量是 RL 后训练成本的最大来源,总参数和 KV cache 主要限制推理速度,并按成本档位推荐 DeepSeek-V4-Flash、GLM-5.2、Kimi K2.6、Kimi K2.7 Code、Nemotron-3-Super-120B 和 Qwen3 系列。选型建议关注库支持、基准表现和后训练循环成本三方面。

    推荐理由:原文把后训练成本拆解为活跃参数、总参数和 KV cache 三个因素,并按成本档位比较了多款开源模型,方法可直接迁移到选型。

  4. 公众号:千问APP(阿里)41

    天体物理学博士刘博洋用千问复现Druckmüller算法,日全食后3小时产出高清日冕图

    8月12日西班牙出现欧洲大陆27年来首次日全食,全食持续101秒,天体物理学博士刘博洋在日食结束后不到3小时产出了高清日冕精细结构图。他此前把Druckmüller的五篇论文交给千问「工作助理」分析核心思路,悟出大师方法的本质是模拟人眼的局部差分视觉,并用过去日冕素材迭代100多个版本复现了整套算法。观测现场他还用千问根据低仰角与高仰角曝光数据推算补偿档数、写脚本测试新快门线的参数组合效率。

  5. OpenAI:官网动态(RSS · 排除企业/客户案例)46

    OpenAI 解析 Basis、Clay、Exa 如何把工作流变成 AI 原生运营能力

    OpenAI 发布文章,介绍 Basis、Clay 和 Exa Labs 用 Agent 承接员工入职、账户管理和开发者集成的工作流。Basis 把入职从 2 小时缩短到 30 分钟,Clay 的子智能体每天夜间更新各账户上下文,为销售省下约 1 小时邮件分拣,Exa 用 Codex 监控集成机会并创建 PR、跑测试。文章还给出企业从试点到规模化的六步方法。

  6. Tessl:产品与工程博客66

    Tessl 设计师总结如何把设计判断教给 AI 智能体

    Tessl 设计师复盘在 agent 软件工厂 Kikimora 中把品牌与设计规则编入 AI 工作流的方法,指出设计系统只提供组件、教不会构图。

    推荐理由:作者给出从 Figma diff 反推设计规则、再以技能和全量扫描落地的可复用路径,可迁移到任何用 agent 生产界面的团队。

9月1日周二
  1. IT之家(RSS)35

    豆包与清华大学开设《AI 赋能学术研究:人机互动的知识生产》课程并上线名校专区技能

    清华大学 2026 年秋季学期校级课程《人工智能赋能学术研究:人机互动的知识生产》开放报名,课程与豆包深度合作,覆盖从选题到发表的研究全流程,包括问题发现、知识综述、数据分析与成果发表。授课团队将把学术实践方法沉淀为可复用的 Skill 技能并在豆包电脑端上线,用户在技能板块选择名校专区即可体验;豆包此前还与清华新闻学院共建课程并担任《社会网络分析》课程 AI 助教。