GitHub Copilot app 教程:用 Git worktree 并行运行多个智能体会话
GitHub Copilot app 支持并行运行多个智能体会话,每个会话独立运行并保留各自上下文,可随时切换而不需重新说明任务。每个会话可运行在自己的 Git worktree 上实现隔离,作者以 tailspin-toys 仓库为例演示同时进行添加 funded sort 功能、无障碍审查和运行测试三个任务,用户在 sessions 视图中跟踪进度并审阅结果。
GitHub Copilot app 支持并行运行多个智能体会话,每个会话独立运行并保留各自上下文,可随时切换而不需重新说明任务。每个会话可运行在自己的 Git worktree 上实现隔离,作者以 tailspin-toys 仓库为例演示同时进行添加 funded sort 功能、无障碍审查和运行测试三个任务,用户在 sessions 视图中跟踪进度并审阅结果。
Elon Musk 转发 @RampCapitalLLC 的内容,配文“未来 AI 眼中的人类写代码”,引用原推自嘲“我现在上班就是这样”,以幽默方式调侃人类编程与 AI 的反差。
Tessl 提出反馈回路工程这一实践,把围绕智能体的循环分为内循环(测试、类型、评审)、中循环(维护智能体修复项目本身的状态)和外循环(读取生产信号),认为常被忽略的中循环能改善未来大量变更的条件。
推荐理由:文章提出反馈回路工程的三层框架,并给出 Tessl 自身维护智能体的运行数据,可作为改进智能体开发环境的可迁移方法。
Institute of Foundation Models(IFM)发布开源模型族 K2 Horizon,包含 0.9B 至 375B 参数的六个基础模型,全部以 Apache 2.0 许可开源。
Meta 发布 Muse Spark 1.3,xhigh 档已可用,更强的 max 档目前为有限合作伙伴预览。
Hugging Face 发布开源工具 funes,为 Claude Code、Codex、pi、Hermes 等编码智能体提供本地记忆层,把已有会话记录索引成 Lance 数据集,一条 funes add 命令即可让 Agent 自主召回原始出处(Agent、时间戳、会话、轮次)。
推荐理由:原文给出本地记忆层的检索机制、跨 Agent 复用方式,以及召回比压缩和交接更省成本的基准数字,方法可直接复用。
TestingCatalog 发布9月3日AI日报,汇总多家公司动态。Gemini 3.8 Flash 上线,1M 上下文,12月31日前入门价 $0.75 / $3.75。
开发者 Rick Brewster 于 9 月 1 日发布 Paint.NET 5.2 Build 9739 版,通过 Wine 首次实验性支持 Linux。最大障碍是 Paint.NET 长期依赖的 Direct2D 图形 API 在 Wine 上支持不完善,他自行开发了内部替代方案实现所需核心功能。
LoopArena 基准(arxiv.org/abs/2608.28281)评测模型作为运行时 Controller 指导固定编码 Worker(Qwen3.7-Plus)完成长任务的能力。
作者总结一周高强度使用豆包的经验,介绍如何把豆包当成国产 Codex 使用。核心差异在于豆包把本地电脑和云电脑(Windows 虚拟机)打通,切换即可,而 Codex 本地和云端是两套分开的环境;授权一次飞书后可直接用 PRD、表格、会议预约等内置工具。
PaperCompiler 是一个论文到代码生成框架,将论文证据编译为显式的仓库级实现规格,区分论文支持、推断、外部委托和未解决的信息,并编码非退化要求、文件归属、跨文件依赖和文件级约束。
论文提出端到端后训练管线,用 22,000 道精选题目、合成推理轨迹、SFT 和 RL 训练 Nemotron-3-Nano-CC(30B-A3B),并以 SFT 训练 Nemotron-3-Ultra-CC(550B-A55B),同时引入迭代生成、评估和改进解法的 GenCorrect 测试时计算策略。
fable51-worlds 项目发布由自主 Claude Fable 5.1 智能体集群端到端研究、建模并质检的真实街区重建,以纯 Three.js 应用交付,无需游戏引擎或专有 3D 格式。
Qwen 开发者团队发布开源工具 zg(zvec-grep),将 ripgrep、BM25 与向量搜索统一到一个本地优先接口,代码以 Apache 2.0 许可发布在 zvec-ai GitHub 组织下,可通过 npm 安装 @zvec/zvec-grep,需 Node.js 22+,默认模型无需 GPU。
Epoch AI 发布对 SWE-bench Verified 的基准评审,认定其为 Flawed。该基准用 500 道来自 12 个代码库的修复任务评测大语言模型;OpenAI 审计 27.6% 的任务后发现有缺陷测试的任务下限为 16.4%,59.4% 的被审任务测试用例会拒绝功能正确的提交,且所有受测前沿模型在训练中都见过部分题目。
推荐理由:Epoch 汇总了 OpenAI 与 RDI 的公开审计结论,说明 SWE-bench Verified 的测试缺陷和污染问题,读者可据此调整对该基准的解读。
本期早报围绕能力、工作过程与最终成本展开,精讲三篇:Google 发布 Gemini 3.8 Flash 系列含通用 Flash 与 Flash Cyber,内部漏洞发现成功率超 70%。
BestBlogs 09-03 早报汇总十条 AI 内容:Google 发布 Gemini 3.8 Flash 与 Cyber,提升长周期编程与漏洞修复推理能力。
西班牙 AI 公司 Multiverse Computing 推出 4,380 亿参数的推理模型 Quasar 438B,在 Artificial Analysis Intelligence Index v4.1.1 得分 43,为参与比较的欧洲模型中最高。
Meta 于 2026 年 9 月 2 日发布 AI 模型 Muse Spark 1.3,专为延长智能体工作流与增强编码能力设计,Meta 首席 AI 官 Alexandr Wang 称其编码能力超越 GPT-5.6 Sol、与 Claude Fable 5.1 持平。
Claude Code 发布 v2.1.259。新增 managedMcpServers 托管设置供组织向所有用户提供 HTTP/SSE MCP 服务器,新增 --permission-prompts none 支持无人值守 headless 场景下自动拒绝权限请求,并支持 GitLab MR(glab)命令识别与 claude plugin validate -- 输出。
GitHub Podcast 一期节目配套文章由 Cassidy Williams 与 Marlene Mhangami 等解读当下 AI 开发常见新术语。
Google 发布 Gemini 3.8 Flash,称其比 3.7 Flash 在复杂任务上执行更多推理步骤并迭代调用工具,定价维持每百万输入 token $0.75、输出 $3.75,但警告模型可能消耗更多 token 导致实际成本上升。