跳到正文

#编码

今日 1 条
9月4日周五
  1. GitHub Blog56

    GitHub Copilot app 教程:用 Git worktree 并行运行多个智能体会话

    GitHub Copilot app 支持并行运行多个智能体会话,每个会话独立运行并保留各自上下文,可随时切换而不需重新说明任务。每个会话可运行在自己的 Git worktree 上实现隔离,作者以 tailspin-toys 仓库为例演示同时进行添加 funded sort 功能、无障碍审查和运行测试三个任务,用户在 sessions 视图中跟踪进度并审阅结果。

  2. Tessl:产品与工程博客62

    Tessl 提出反馈回路工程:用内、中、外三层循环让项目对智能体更友好

    Tessl 提出反馈回路工程这一实践,把围绕智能体的循环分为内循环(测试、类型、评审)、中循环(维护智能体修复项目本身的状态)和外循环(读取生产信号),认为常被忽略的中循环能改善未来大量变更的条件。

    推荐理由:文章提出反馈回路工程的三层框架,并给出 Tessl 自身维护智能体的运行数据,可作为改进智能体开发环境的可迁移方法。

9月3日周四
  1. Hugging Face:Blog(RSS)72

    Hugging Face 发布开源工具 funes,为编码智能体提供可本地持有的记忆层

    Hugging Face 发布开源工具 funes,为 Claude Code、Codex、pi、Hermes 等编码智能体提供本地记忆层,把已有会话记录索引成 Lance 数据集,一条 funes add 命令即可让 Agent 自主召回原始出处(Agent、时间戳、会话、轮次)。

    推荐理由:原文给出本地记忆层的检索机制、跨 Agent 复用方式,以及召回比压缩和交接更省成本的基准数字,方法可直接复用。

  2. 公众号:卡尔的AI沃茨67

    实测豆包当国产 Codex 用的 7 种玩法

    作者总结一周高强度使用豆包的经验,介绍如何把豆包当成国产 Codex 使用。核心差异在于豆包把本地电脑和云电脑(Windows 虚拟机)打通,切换即可,而 Codex 本地和云端是两套分开的环境;授权一次飞书后可直接用 PRD、表格、会议预约等内置工具。

  3. Epoch AI:研究、数据与评测69

    Epoch AI 评测 SWE-bench Verified:审计发现超两成题目存在评分问题

    Epoch AI 发布对 SWE-bench Verified 的基准评审,认定其为 Flawed。该基准用 500 道来自 12 个代码库的修复任务评测大语言模型;OpenAI 审计 27.6% 的任务后发现有缺陷测试的任务下限为 16.4%,59.4% 的被审任务测试用例会拒绝功能正确的提交,且所有受测前沿模型在训练中都见过部分题目。

    推荐理由:Epoch 汇总了 OpenAI 与 RDI 的公开审计结论,说明 SWE-bench Verified 的测试缺陷和污染问题,读者可据此调整对该基准的解读。