跳到正文

#编码

今日 0 条
9月18日周五
  1. Anthropic:Research(发表成果 · 网页)74

    Anthropic:Claude 四周优化 30 多个开源生物分子模型,平均提速约 4 倍并开源代码

    Anthropic 让 Claude 在不到四周内优化了超过 30 个开源生物分子模型,平均提速约 4 倍、精度损失极小,输出完全一致时也有近 2 倍加速。优化代码全部开源,还推出低内存 Big 模式,可在单张 NVIDIA GPU 节点上对超过 10,000 token 的生物分子系统做准确预测。

    推荐理由:Anthropic 公布了完整提速数据、开源代码和比赛入口,读者可以据此评估 AI 优化科学计算代码的实际水平。

  2. Claude:Blog(网页)70

    Claude Code Projects 改版:从文件夹到对话式协调

    Anthropic 宣布 Claude Code 的 Projects 改版,用户设定目标后由 Claude 拆解任务、协调并行线程、审查输出并汇总结果。每个线程是一个独立的 Claude Code 云会话,各占一个分支跑测试、开 PR,项目还带随时间积累的共享记忆和文件库。

    推荐理由:官方说明了项目改版的线程协调机制、共享记忆和推送节奏,读者可以据此判断是否要加入等待名单。

9月17日周四
  1. GitHub Blog87

    GitHub 用 Copilot 智能体将 Copilot 运行时从 TypeScript 迁移到 83 万行 Rust

    GitHub 工程师 Stephen Toub 复盘用 Copilot 智能体在约 14.5 周内将 Copilot agent runtime 从 TypeScript/Node.js 全量重写为 832,378 行生产 Rust,AI 智能体完成大部分代码,共 128 个 PR 增量合入 main 并持续发布。

    推荐理由:当事工程师复盘用 AI 智能体在数月内将 Copilot 运行时迁往 Rust 的全过程,策略、回归样本和成本数据对同类迁移有直接参考价值。

  2. xAI:News(网页)61

    Grok Build 推出记忆功能,可跨会话保留项目约定与决策

    xAI 宣布 Grok Build 上线记忆功能,会在每轮对话结束后于后台记录项目约定、决策及事实,供后续会话读取。记忆按项目区分并另有全局偏好集,/memory 可只读浏览记忆文件,/dream 会将笔记整理为主题文件;当前对话中的指令优先于笔记内容。

    推荐理由:原文说明了记忆的记录、整理和优先级机制,读者可以据此评估它对长期项目编码工作流的影响。

  3. Tessl:产品与工程博客55

    Tessl提出用可执行规范解决AI代码审查瓶颈

    Tessl博客指出,AI编码代理导致PR数量激增但审查变慢,核心原因是缺乏对输出结果的信任。文章主张建立“验证层”,将产品意图转化为“可执行规范”。通过拆分规划与验证代理、结合规范与代码进行比对、并在隔离沙箱中运行以规避安全风险,旨在让代理自动检查实现是否符合原始需求,从而提升工程效率。

9月16日周三
9月15日周二
  1. Trail of Bits:AI安全研究61

    Trail of Bits 批评 1Password 的 AI 补丁基准存在误导,并发布两个补丁验证 Agent 技能

    Trail of Bits 发文批评 1Password 8月6日发布的 FLAWED 报告,称其 26% 的 AI 干净修复率受四项实验设计选择影响而失真,包括刻意指示智能体应用错误修复的提示词占 22% 数据、36% 的试验禁止编译测试,以及不同推理档位设置。

    推荐理由:原文针对1Password基准的26%头条数字给出逐项方法学批评,并补充自身人类修复失败率与开源合并数据作对照。

  2. Claude:Blog(网页)66

    Anthropic 工程师复盘:智能体编程压力下如何扩展测试影响分析服务

    Anthropic 工程师撰文分享如何在智能体编程压力下扩展测试影响分析服务。Claude 编写约 80% 的代码,测试数量增长 10x,六个月内 CI 任务增加 25x。文章复盘了三个临时补丁(扩容、按包分片、每日重启)分别只维持 70 天、29 天和不到一天,最终用三周重设计为无状态、内存存储加 journal 的可水平扩展架构,并建议团队按两季度内 25x 负载做容量规划。

    推荐理由:作者复盘了智能体编程把 CI 推向 25x 负载的完整演进,给出可迁移的架构与容量规划经验。

  3. Tessl:产品与工程博客63

    Tessl 提出 Agent 上下文归属模型:所有权跟随组织单元

    Tessl 发文提出智能体转型的真正难点是上下文等要素的归属问题,而非 Agent 本身。核心规则是所有权跟随组织单元,个人与团队上下文归领域专家,组织级共享基础由赋能或平台团队托管并开放贡献,赋能团队只提供工具和基础设施而不拥有上下文。

    推荐理由:文章把智能体转型的难点从模型转向上下文归属,给出按组织单元分层确权和赋能团队只供工具不拥有上下文的可迁移框架。

  4. SiliconFlow66

    硅基流动(SiliconFlow)宣布开源模型 Hy4 preview 上线其平台。该模型总参数 770B、每 token 激活 49B、支持 1M 上下文,采用 Apache 2.0 协议,面向编码、分析、研究和复杂实际工作。用户可将其接入 Claude Code、Codex、Cursor 等已有工具;图片显示定价为每 1M tokens 输入 $0.834、输出 $2.501、缓存 $0.042。

    推荐理由:原文给出了参数规模、上下文长度、开源协议和定价,读者可据此评估它能否接入现有编码与 Agent 工具链。

9月14日周一
  1. OpenRouter:Announcements(RSS)61

    OpenRouter 教程:用 LLM-as-a-judge 自动评估 AI 智能体输出

    OpenRouter 发布教程,讲解如何用独立的裁判模型按自定评分标准自动给 AI 智能体输出打分,覆盖确定性测试无法检查的开放式回答质量。

    推荐理由:原文给出 LLM-as-a-judge 的适用边界、偏差来源和用 Ori Eval 落地的可复用步骤,还包含用人工标注校准裁判模型的方法。

9月13日周日
9月12日周六
  1. Baseten 工程博客(网页)76

    DeepSeek 发布开源模型 DeepSeek-V4.1-Flash,优化编码智能体 prefill 效率

    DeepSeek 本周在 HuggingFace 开源 DeepSeek-V4.1-Flash 权重,模型总参数 552B,prefill 激活 8B、decode 激活 16B,支持 1M token 上下文和文本加图像输入,已上线 Baseten Model APIs。

    推荐理由:文章解释了 CED 架构如何把 prefill 降到 8B 激活参数并压缩 KV cache,读者能理解它为何更适配编码智能体的高 prefill 负载。

9月11日周五
  1. Cursor Blog78

    Cursor 推出 Projects:协调者智能体管理数千个子智能体处理大型开发任务

    Cursor 发布 Projects(beta),让用户通过协调者智能体处理功能开发、迁移和持续性维护等大型工作,协调者本身不写代码,而是调度数千个子智能体并行执行。

    推荐理由:官方介绍 Projects 的三项核心能力,并给出内部使用数据,读者可据此判断它适合什么规模的工作。

  2. GitHub Blog53

    GitHub Copilot 应用入门教程:用 diff、终端和浏览器面板审查 AI 代码

    GitHub Copilot 应用新增 diff、终端、浏览器三个内置面板,让初学者在不离开应用的情况下完成 AI 智能体改动的审查、运行和预览。diff 面板以红绿高亮显示增删改行,用户可接受、评论或要求修改;终端面板可运行项目命令并支持多窗口,浏览器面板配合 Pick & Polish 工具选中界面元素让智能体调整,最后可直接在应用内接受变更并创建 pull request。

  3. OpenAI:官网动态(RSS · 排除企业/客户案例)81

    OpenAI 发布 Agents API 公测版

    OpenAI 推出 Agents API 公开测试版,将驱动 Codex 的 harness 与基础设施通过单次 API 调用开放给开发者,托管在云端。

    推荐理由:原文给出环境选择、子智能体和上下文管理等具体能力与定价方式,读者可据此评估是否迁移现有 Agent 基础设施。

9月10日周四
  1. DeepSeek:API 更新日志80

    DeepSeek 发布 V4.1-Flash,API 价格同步下调

    DeepSeek 发布 DeepSeek-V4.1-Flash,是全新模型结构系列中最小尺寸的模型,具备原生多模态视觉理解能力,评测包括 GPQA Diamond 90.9、HLE 36.8、Codeforces Rating 3471、Terminal-Bench 2.1 90.6 等。

    推荐理由:官方发布附带完整评测数字和 API 切换细节,读者可据此判断新模型能力水平及旧模型下线对现有调用和计费的影响。