跳到正文

#Agent

今日 19 条
9月3日周四
  1. Meta Engineering Blog(RSS)53

    Meta 构建“组织第二大脑”AI Agent,从专家反馈中沉淀机构知识

    Meta 发布技术博客,介绍其为合规领域构建的 AI Agent,用结构化知识系统加可组合 recipes 复现专家推理方式,专家反馈经诊断、编译、验证和人工审核后写入 200+ 知识文件,无需重新训练模型。六周三轮开发后,单项评估时间从数天缩短到数分钟,改进周期内零回归,每轮修复自动加入回归测试集。

  2. Tomer Tunguz 博客(VC 分析)57

    Tomer Tunguz:AI 生产力不是减少工作量,而是抬高产出上限

    Tomer Tunguz 分享其与 Agent 协作的写作流程:AI 秒级起草,他逐行审阅、下指令修改,从不直接碰原始文本。他发现行级编辑量中位数稳定在约 136 处,时间并未缩短;用评分量表让 AI 评审 2021 到 2026 每年 15 篇已发布文章,综合质量分各档位都上升,第 10 百分位从 2.59 升至 3.81,涨幅接近第 90 百分位的两倍。

  3. GitHub Blog62

    GitHub Copilot 如何在不牺牲任务质量的前提下降低 AI 编码成本

    GitHub 工程师 Erik Kristensen 分享了 Copilot 降本的四项改动:选择性压缩工具输出、移除 view 工具行号前缀(线下推理成本降约 5%,线上用户日均推理成本降约 3%)、压缩 task-tool 提示词(每轮省约 1300 token,每活跃小时归一化成本降 2.9%)、后台任务完成后直接交付结果(AI Credits 用量降约 2.3%)。

    推荐理由:GitHub 用四项改动说明压缩 token 为何要看整个任务而非单次调用,并给出可复用的评估方法与踩坑教训。

  4. Cursor Blog68

    Cursor 推出 Self-Hosted Machines,云智能体可在企业自有机器上执行

    Cursor 发布 Self-Hosted Machines,让云智能体的工具执行迁移到企业自有网络内的机器,智能体循环、推理和规划仍留在 Cursor 云端,通过 worker 的出站 HTTPS 连接对接,Cursor 不会主动连入企业网络。

    推荐理由:官方介绍了让智能体工具执行迁入企业自有基础设施的方案与适用场景, teams 可据此判断何时值得自托管以及如何按需扩容。

  5. Claude:Blog(网页)64

    Anthropic 发布 Claude 商务智能体蓝图,含购物与商家智能体参考实现

    Anthropic 发布面向电商、旅游、电信和票务平台的商务智能体蓝图,提供可在数天内上线的 harness、模式和护栏,附购物智能体与商家智能体的完整参考实现及 Claude Code 插件。

    推荐理由:原文给出完整可部署的购物与商家智能体实现、接入方式和合作生态,工程团队可据此评估落地铁路线。

  6. Claude:Blog(网页)79

    Anthropic 发布 Claude 电商智能体构建指南及参考实现

    Anthropic 发布构建电商智能体的指南,总结架构、延迟与成本优化、生产运维三部分实践,涉及购物和商家两类智能体,企业客户部署后出现购物车变大和卖家运营效率提升。核心建议包括用单个智能体加技能而非子智能体、将 UI 组件做成工具、用提示词缓存实现 90-99% 命中率、在 harness 中强制安全规则,并开源参考实现 anthropics/commerce-agents。

    推荐理由:Anthropic 根据多个企业部署经验总结电商智能体架构、延迟成本优化和生产实践,并附参考实现,可迁移到类似 Agent 项目。

  7. Google AI:DEV 作者专属(RSS)66

    Google AI 团队分享如何为 LLM-as-a-Judge 评测编写可靠的评分标准

    Google AI 团队发布教程,讲解如何为 LLM-as-a-Judge 评测编写可靠的布尔式评分标准,指出模糊提示会导致评估不一致和浪费 token。文中给出四条经验:问题保持原子化且互不重叠、只让评判模型评估客观事实(可用 RFC 2119 术语如 MUST 表述)、只评 prompt 中明确要求的内容、用专家标注的 golden set 校准评判模型直至与人类评分一致。

    推荐理由:作者来自 Google 团队,把写作 LLM-as-a-judge 评分标准的经验整理成四条可迁移规则,附带校准流程,适合自己搭建评测时参考。

  8. Rohan Paul35

    Rohan Paul 转评 @MeetResona 团队推出的直播 AI Agent Resona,该产品面向创作者和教育者,把现有材料变成可实时互动的直播会话。作者认为 Resona 把文档当作 Agent 的知识边界,创作者设定交互目标,Agent 沿方向主动推进讲解,不同于由用户提问驱动的普通文档聊天机器人;引用内容还提到支持 36 种语言切换、可自定时长与定价或免费提供。

  9. TechCrunch:AI(RSS)53

    Wonderful 融资 5.5 亿美元,估值半年内翻倍至 50 亿美元

    以色列-荷兰 AI 创业公司 Wonderful 完成 5.5 亿美元 C 轮融资,估值达 50 亿美元,比近六个月前的 20 亿美元估值翻了一倍多。本轮由 Insight Partners 领投,Salesforce 首次参投;公司已从客服 AI Agent 平台扩展为可协调 Agent、工作流与 AI 应用的 Wonderful AI OS 平台,业务覆盖超过 35 个国家。