Simon Willison 用 Claude Opus 5.5 生成鸮鹦鹉像素动画并用 Claude Code 录成视频
Simon Willison 在 WeAreDevelopers World Congress North America 闭幕主题演讲前,用 Claude Opus 5.5 根据三张鸮鹦鹉照片生成至少 20 只鸮鹦鹉开派对的 HTML 5 canvas 像素动画页面。
Simon Willison 在 WeAreDevelopers World Congress North America 闭幕主题演讲前,用 Claude Opus 5.5 根据三张鸮鹦鹉照片生成至少 20 只鸮鹦鹉开派对的 HTML 5 canvas 像素动画页面。
KernelZero 提出协同进化框架,用 Proposer 从 API 集合生成 Torch 模块、Coder 将其翻译为 CUDA 或 Triton kernel,并引入 CA-GRPO 在正确性可靠后再优化性能。
WideSWE 是用于评估编码智能体跨仓库任务的新基准,从 103 个软件生态系统中挖掘出 120 个真实任务,包含 60 个 bug 修复和 60 个功能开发。
作者发布 Reladraw 0.5.0,一种用相对位置语句(如 below、right of、between)声明元素摆放的文字图表语言,文件中不含任何坐标。
drawgent 是一个开源工具,将用户自己安装的 Claude Code、Codex 或 opencode 连接到 Excalidraw 白板,可通过聊天面板或以 AGENT: 开头的标注请求改图,agent 会截图读取画布、实时编辑并标记 DONE。
Anthropic 发布 Opus 5.5 配套指南,解释 Agent 无人值守时常在汇报完进度后停在半路,原因是模型爱发汇报、旧程序把 end_turn 当成任务完成。
一位资深开发者分享其从依赖AI编码到决定停用一个月的经历。起初他享受AI带来的速度提升,但随后陷入“Tokenmaxxing”(多任务并行)的陷阱,导致上下文切换频繁、精力耗尽。他发现AI生成的代码往往需要大量人工审查和修正,实际交付效率并未如预期倍增,反而因过度依赖而丧失对代码的控制权和理解力,甚至产生羞耻感。最终他意识到自己数月未亲手写码,决定回归传统开发方式以重拾掌控感。
Nvidia 研究人员提出 SoL-Pi 系统,用研究 agent 自动优化编码 agent 的控制层(harness),在 EdgeBench 上相比 Codex 节省 50%、相比 Claude Code 节省 54.3% 的 token,性能与原 Pi harness 大致持平。
一位 Haskell 开发者撰文提出在 LLM 辅助下保持编程乐趣与代码掌控权的工作流:规划、研究和杂务交给智能体,核心编码由人完成,并给生成的产物加自动审查循环。他提醒慎用前沿模型的 token 消耗与不透明限额,把 token 耗尽视为服务中断而提前准备离线任务,还建议少读 LLM 生成的文本、保持与人交流代码。他表示这套方法让自己效率约提升一倍,评论区有人补充先写接口再让 AI 实现的做法。
Anthropic 的 Claude Code 团队于 9 月 26 日宣布启用新机制,任务中途触发 5 小时使用上限时不再直接中断编辑,而是寻找合适的收尾点完成收尾工作。收尾所需时间从用户的每周限制中扣除一小段固定时间;Pro 用户每周可使用一次,Max 和 Team Premium 用户每次达到 5 小时会话限制后都可使用。
美团 LongCat API 开放平台于 9 月 25 日上线 LongCat-2.5-Preview 模型,同步开放 API 与网页端体验入口。
作者复盘其围绕规划构建的桌面编码应用 Nuanced 的失败,认为计划模式正变得不再有用。模型理解大型代码库的能力提升,使显式指令和 AI 生成的规格文档价值下降;而规划与构建应交织进行,Codex 等工具正在让计划与执行的边界消融。人类如何在数百个并行智能体快速修改系统时保持连贯的心智模型,仍是未解决的问题。
Relic 将多智能体协作中反复出现的失败转化为组织所有、可执行的协议,把触发条件、责任、所需证据与执行后果绑定到运行时,并支持修订与退役。在十个软件工作负载、三个模型共 360 次受控运行中,完整契约交付率从 14.06% 提升至 19.76%(+5.71 个百分点)。
GAGAR 是一个面向代码智能体强化学习的质量感知信用重分配框架,通过 SFT 训练的智能体评分器在同一工作区内联合检查并排序通过测试的轨迹,对低排名轨迹降权并按比例重缩放优势值以保持总和不变。
作者评论 DHH 在 Rails World 2026 开幕主题演讲:37signals 将用 LLM 重写 Hey 为各平台原生应用、服务端改用 Rust,DHH 称 8 月用 LLM 产出 15 万行代码,而 Ruby 仅占其今年产出的 3%。
Go 团队宣布 Go 1.26 和 1.27 引入实验性 SIMD API,Go 1.27 新增完全可移植、平台与向量长度无关的 simd 包,松散借鉴 C++ 的 Highway,目标是在支持 SIMD 的平台上写出一次编写、接近汇编性能的代码。
作者发布 jevmem v0.5,一个为 Claude Code 自动保存项目记忆的工具,将对话中的决策、约束、bug 和 todo 写入 JEVMEM.md,旧结论标记为 superseded 而非删除,下次会话注入相关记忆行;也支持 Cursor 和 Codex。
推荐理由:原文把 Opus 5.5 的降价幅度换算成 Claude Code 中单个任务的实际成本,并提供计算器供读者自行测算。
GitHub 官方博客发布 GitHub Copilot app 新手教程,介绍用 /create-canvas 技能通过自然语言描述生成可自定义的 canvas 界面。
推荐理由:教程来自 GitHub Copilot 官方博客,讲解了用 /create-canvas 生成双向共享界面的具体做法,适合想定制智能体工作流的读者上手。
Cognition 宣布年化收入运行率突破 10 亿美元。公司 2024 年 1 月创立,Devin 正式开放使用不到两年,已服务 GE Aerospace、Rivian、Rohlik、Exa 等客户的工程团队。
推荐理由:官方披露年收入运行率破 10 亿美元,并列出 GE Aerospace、Rivian 等客户,可作了解 Devin 商业化进展的参考。
微软推出新版 Copilot 应用,包含 Home、Code 和 Copilot 三种模式,已通过 Frontier 项目开始推出。
微软发布新版 Copilot“超级应用”,将聊天、编程和智能体能力集中到同一界面,定位为“为工作而生的 AI”。
Microsoft 正式发布重新设计的 Copilot 超级应用,将 AI 聊天、编码和智能体整合为 Home、Code、Autopilot 三个标签页,并把此前在 Build 上发布的 Scout 更名为 Autopilot。
Ruby on Rails 创始人、Basecamp 联合创始人 David Heinemeier Hansson 在 Rails World 2026 演讲中宣布,自 2026 年 3 月前后起已不再手写任何代码。
arXiv 论文(https://arxiv.org/abs/2609.30233)研究 coding agent 能否自动合成可跨实例泛化的程序来解决广义任务与运动规划(TAMP)问题。
作者发布 launchvideo.io 与 diggerhq/shipvideo 仓库,用 anthropic/claude-opus-5.5 通过 OpenComputer serverless agent 把一个 URL 或提示词直接渲染成 MP4 讲解视频,单次运行无人工编辑。
GitHub Copilot 员工撰文认为聊天框往往不是与 AI 协作的正确界面,并介绍 GitHub Copilot app 中的 canvas 功能:canvas 是运行在 app 内、无浏览器外壳的全栈小应用,可与 agent 双向通信。
GitHub Security Lab 的 Antonio Morales 开源了基于 Taskflow Agent 的 Fuzzing Taskflow,指向 GitHub 仓库即可自动识别入口点、编写 harness、运行 AFL++、读取覆盖报告并分诊崩溃。
推荐理由:作者开源了完整的自主模糊测试流水线,并讲清覆盖反馈、结构感知和崩溃分诊的设计取舍,C/C++ 维护者可直接复用。
Whiteboard 团队发布同名开源桌面应用,让人类与 Claude Code、Codex 等编码智能体在共享画布上共同进行软件架构设计,通过 SDK 让智能体在画布上绘制说明。
LangChain 在 Interrupt 26 大会上发布 LangSmith Fine-Tuning,配套开源 CLI smithtune(github.com/langchain-ai/smithtune)。
Tomer Tunguz 撰文认为手写代码对多数程序员已不再是经济上有产出的工作,软件工程正转向设计让 AI 大规模正确写代码的系统。
Anthropic 发文解释 Claude Opus 5.5 为长上下文编码会话降本的三方面变化:输入输出 token 降价 20%、缓存读取降价 60%,模型可用更少轮次完成同一任务,Claude Code 也改进了缓存利用。
Endura Therapeutics CEO Adrian Sanborn 在 Latent Space 发表客座文章,提出生物科技公司应对 AI 的两种路径:用新技术把实验数据产出提速一个数量级的 Foundries,以及把 LLM 融入日常运营提升决策的 Navigators。
Factory 宣布 Factory Router 的生产环境推理成本节省从 6 月下旬的 42% 升至截至 9 月 13 日当周的 63%,同期路由会话量增长约四倍。
Lovable 联创 Fabian Hedin 在 HumanX 峰会上表示,公司年化收入已突破 6 亿美元,高于 6 月披露的约 5 亿美元。他称三分之二的财富 500 强企业正在使用该产品,客户包括 Microsoft、NVIDIA 和 Deutsche Telekom,平台上用户创建的应用每月合计获得近 10 亿次访问。