跳到正文

全部动态

今日 13 条
9月3日周四
  1. GitHub Blog62

    GitHub Copilot 如何在不牺牲任务质量的前提下降低 AI 编码成本

    GitHub 工程师 Erik Kristensen 分享了 Copilot 降本的四项改动:选择性压缩工具输出、移除 view 工具行号前缀(线下推理成本降约 5%,线上用户日均推理成本降约 3%)、压缩 task-tool 提示词(每轮省约 1300 token,每活跃小时归一化成本降 2.9%)、后台任务完成后直接交付结果(AI Credits 用量降约 2.3%)。

    推荐理由:GitHub 用四项改动说明压缩 token 为何要看整个任务而非单次调用,并给出可复用的评估方法与踩坑教训。

  2. Cursor Blog68

    Cursor 推出 Self-Hosted Machines,云智能体可在企业自有机器上执行

    Cursor 发布 Self-Hosted Machines,让云智能体的工具执行迁移到企业自有网络内的机器,智能体循环、推理和规划仍留在 Cursor 云端,通过 worker 的出站 HTTPS 连接对接,Cursor 不会主动连入企业网络。

    推荐理由:官方介绍了让智能体工具执行迁入企业自有基础设施的方案与适用场景, teams 可据此判断何时值得自托管以及如何按需扩容。

  3. Baseten 工程博客(网页)41

    Baseten 为编码智能体推出 MCP 服务器与技能包

    Baseten 发布后端 MCP 服务器(api.baseten.co/mcp)、文档 MCP 服务器和开源技能包 basetenlabs/baseten-skills,让编码智能体可直接部署模型、查看部署健康状态并从日志调试。

  4. Claude:Blog(网页)64

    Anthropic 发布 Claude 商务智能体蓝图,含购物与商家智能体参考实现

    Anthropic 发布面向电商、旅游、电信和票务平台的商务智能体蓝图,提供可在数天内上线的 harness、模式和护栏,附购物智能体与商家智能体的完整参考实现及 Claude Code 插件。

    推荐理由:原文给出完整可部署的购物与商家智能体实现、接入方式和合作生态,工程团队可据此评估落地铁路线。

  5. Claude:Blog(网页)79

    Anthropic 发布 Claude 电商智能体构建指南及参考实现

    Anthropic 发布构建电商智能体的指南,总结架构、延迟与成本优化、生产运维三部分实践,涉及购物和商家两类智能体,企业客户部署后出现购物车变大和卖家运营效率提升。核心建议包括用单个智能体加技能而非子智能体、将 UI 组件做成工具、用提示词缓存实现 90-99% 命中率、在 harness 中强制安全规则,并开源参考实现 anthropics/commerce-agents。

    推荐理由:Anthropic 根据多个企业部署经验总结电商智能体架构、延迟成本优化和生产实践,并附参考实现,可迁移到类似 Agent 项目。

  6. Google AI:DEV 作者专属(RSS)66

    Google AI 团队分享如何为 LLM-as-a-Judge 评测编写可靠的评分标准

    Google AI 团队发布教程,讲解如何为 LLM-as-a-Judge 评测编写可靠的布尔式评分标准,指出模糊提示会导致评估不一致和浪费 token。文中给出四条经验:问题保持原子化且互不重叠、只让评判模型评估客观事实(可用 RFC 2119 术语如 MUST 表述)、只评 prompt 中明确要求的内容、用专家标注的 golden set 校准评判模型直至与人类评分一致。

    推荐理由:作者来自 Google 团队,把写作 LLM-as-a-judge 评分标准的经验整理成四条可迁移规则,附带校准流程,适合自己搭建评测时参考。

  7. Google DeepMind74

    WeatherNext 3 发布,天气 AI 接入搜索、地图和开发者数据服务

    WeatherNext 3 结合实时卫星和地面观测生成逐小时天气预报,并开始接入搜索、Gemini、地图及开发者数据服务。温湿度采用五公里网格,其他变量分辨率不同;其降水精度提升来自具体评测,不能扩大成所有地区和天气都更准确。

    推荐理由:天气模型开始进入日常查询与开发者数据服务,公开的分辨率和评测范围有助于判断预测数据适用的场景。

  8. AGIBOT 智元(网页)49

    智元开源 AGIBOT WORLD 2026 第三期强化学习数据集

    智元发布 AGIBOT WORLD 2026 第三期开源强化学习数据集,首批覆盖 11430 条轨迹,含 1024 条成功与 1369 条失败 Rollout,并标注 98159 个子任务区间、26493 段干扰片段、5795 段错误状态和 10684 段人工接管。数据覆盖专家示教、部署推理与人类在环纠正三阶段,可用于训练奖励模型与价值模型,已在 HuggingFace 开源。

  9. ARC Prize:官方博客79

    ARC Prize 发布 OpenAI GPT-6 Astra 在 ARC-AGI-3 上的评测结果

    ARC Prize 报告 OpenAI 的 GPT-6 Astra 在 ARC-AGI-3 Semi-Private 上,Standard harness 得分 62.7%(成本 $26K),Provider Adapter harness 得分 99.9%(成本 $19K),均为 SOTA。

    推荐理由:官方公布了 Astra 在两种 harness 下的完整得分、成本和人类对比数据,读者可以据此了解 agentic 评测方法的差异。

  10. NVIDIA Technical Blog:Agentic AI / Generative AI46

    NVIDIA 如何跨联邦 Kubernetes 与 AI 平台传递用户身份

    NVIDIA 提出中央身份网关模式,在联邦数据平面间传递用户身份:中央网关持有平台会话,数据平面网关通过共享 API 校验会话并转换为本地可信身份上下文,方案基于标准 OIDC、共享会话存储和无状态数据平面网关。

  11. LlamaIndex:产品、工程与评测56

    LlamaIndex 发布 Turbo 抽取档位,中位速度每页 3.7 秒

    LlamaIndex 在 LlamaParse 平台以 beta 形式推出抽取档位 Turbo,主打低延迟实时工作流。在自建开放基准 ExtractBench 上,其速度约为 Cost Effective 模式的 4 倍,中位处理时间每页 3.7 秒,F1 为 0.84;中等及以上长度文档因页面并行处理降至每页约半秒。定价为每页 35 credits,目前支持的输入类型和配置选项少于其他抽取档位。

9月2日周三

最多提供 50 页,更早的内容请使用搜索或主题页。