跳到正文

#编码

今日 1 条
9月15日周二
  1. Hacker News 热门(buzzing.cc 中文翻译)53

    将 35kb 预提示从 Opus 迁移到自托管 Ollama 的踩坑笔记

    作者分享把 35kb 预提示从 OpenAI/Anthropic 迁移到自托管 Ollama 的实验笔记,在 65k token 上下文窗口下大提示词会迅速饱和并导致 Agent 重复工具调用。他提出单目标提示拆分、声明式定义 opencode agents、显式调大 ollama 上下文、会话状态落盘等做法,并列出上下文耗尽的失败信号如连续相同工具调用与重复读文件。

  2. Hacker News:AI 热帖77

    GPT-5.6 Luna 对比 GPT-6 Astra:$1.20 的模型做代码评审够用吗

    Entelligence 在 50 个公开基准 PR 上用相同提示词对比 GPT-5.6 Luna 和 GPT-6 Astra 的代码评审能力,Luna 找到 69 个经验证 bug(Astra 92 个),总成本 $0.20 对 $5.66,精度 74% 对 96%。

    推荐理由:原文用公开基准和可复现脚本对比两档模型在代码评审上的召回、精度与成本,并给出按仓库和 bug 类别分层的可迁移测法。

  3. Claude:Blog(网页)66

    Anthropic 工程师复盘:智能体编程压力下如何扩展测试影响分析服务

    Anthropic 工程师撰文分享如何在智能体编程压力下扩展测试影响分析服务。Claude 编写约 80% 的代码,测试数量增长 10x,六个月内 CI 任务增加 25x。文章复盘了三个临时补丁(扩容、按包分片、每日重启)分别只维持 70 天、29 天和不到一天,最终用三周重设计为无状态、内存存储加 journal 的可水平扩展架构,并建议团队按两季度内 25x 负载做容量规划。

    推荐理由:作者复盘了智能体编程把 CI 推向 25x 负载的完整演进,给出可迁移的架构与容量规划经验。

  4. Tessl:产品与工程博客63

    Tessl 提出 Agent 上下文归属模型:所有权跟随组织单元

    Tessl 发文提出智能体转型的真正难点是上下文等要素的归属问题,而非 Agent 本身。核心规则是所有权跟随组织单元,个人与团队上下文归领域专家,组织级共享基础由赋能或平台团队托管并开放贡献,赋能团队只提供工具和基础设施而不拥有上下文。

    推荐理由:文章把智能体转型的难点从模型转向上下文归属,给出按组织单元分层确权和赋能团队只供工具不拥有上下文的可迁移框架。

  5. SiliconFlow66

    硅基流动(SiliconFlow)宣布开源模型 Hy4 preview 上线其平台。该模型总参数 770B、每 token 激活 49B、支持 1M 上下文,采用 Apache 2.0 协议,面向编码、分析、研究和复杂实际工作。用户可将其接入 Claude Code、Codex、Cursor 等已有工具;图片显示定价为每 1M tokens 输入 $0.834、输出 $2.501、缓存 $0.042。

    推荐理由:原文给出了参数规模、上下文长度、开源协议和定价,读者可据此评估它能否接入现有编码与 Agent 工具链。

9月14日周一
  1. 凡人小北60

    OpenAI 收购 Git AI,后者专门追踪 AI 代码的生成、成本与实际投产情况,可记录每行代码由哪个 Agent、哪个模型生成、消耗多少 Token、是否进入生产环境及返工次数。Git AI 已运行在数十万台开发设备上,加入 OpenAI Codex 团队。作者认为企业大规模采用 Coding Agent 后更关心经济账,AI 参与工作的成本与收益将逐步成为企业管理的一部分。

  2. OpenRouter:Announcements(RSS)61

    OpenRouter 教程:用 LLM-as-a-judge 自动评估 AI 智能体输出

    OpenRouter 发布教程,讲解如何用独立的裁判模型按自定评分标准自动给 AI 智能体输出打分,覆盖确定性测试无法检查的开放式回答质量。

    推荐理由:原文给出 LLM-as-a-judge 的适用边界、偏差来源和用 Ori Eval 落地的可复用步骤,还包含用人工标注校准裁判模型的方法。

  3. Hacker News:AI 热帖85

    Anthropic 报告称胡塞组织用 Claude Code 开发导弹制导软件

    Anthropic 9 月威胁报告披露,据评估极可能关联胡塞组织的也门小组使用 Claude Code 开发制导火箭、射程超 2,000 公里弹道导弹及名为 R2000 的高超声速滑翔载具概念的相关软件。

    推荐理由:原文梳理了 Anthropic 威胁报告中也门组织用 Claude Code 并行推进导弹研发的完整链条,可帮助读者理解 AI 滥用如何绕过安全防护。

9月13日周日
9月12日周六
  1. Baseten 工程博客(网页)76

    DeepSeek 发布开源模型 DeepSeek-V4.1-Flash,优化编码智能体 prefill 效率

    DeepSeek 本周在 HuggingFace 开源 DeepSeek-V4.1-Flash 权重,模型总参数 552B,prefill 激活 8B、decode 激活 16B,支持 1M token 上下文和文本加图像输入,已上线 Baseten Model APIs。

    推荐理由:文章解释了 CED 架构如何把 prefill 降到 8B 激活参数并压缩 KV cache,读者能理解它为何更适配编码智能体的高 prefill 负载。

9月11日周五