AI 正在破坏职场信任:一位工程师对代码评审的反思
工程师 matheusml 撰文称,AI 让人无需理解就能生成代码、文档和评审回复,动摇了“署名即代表理解”的职场信任默认。他说自己评审时的问题已从“这个改动好吗”变成“作者是否理解自己提交的内容”,并坦承自己也曾合并过未理解的 AI 修复。文末给出建议:工程师发送前先读懂并精简自己的 diff,负责人则应明确“可评审”标准、允许坦承未验证的工作并以身作则。
工程师 matheusml 撰文称,AI 让人无需理解就能生成代码、文档和评审回复,动摇了“署名即代表理解”的职场信任默认。他说自己评审时的问题已从“这个改动好吗”变成“作者是否理解自己提交的内容”,并坦承自己也曾合并过未理解的 AI 修复。文末给出建议:工程师发送前先读懂并精简自己的 diff,负责人则应明确“可评审”标准、允许坦承未验证的工作并以身作则。
Quesma 在 Terminal-Bench 2.1 上用 Claude Code(Fable 5.0)和 OpenCode(DeepSeek V4 Pro 0813)实测 RTK(Rust Token Killer),共 1740 次尝试、花费超 1500 美元,结论是 RTK 并不普遍降低成本。
作者用同一台 M4 MacBook Pro(24GB)和 llama.cpp 服务 Qwen 3.8 27B,对 9 套编程线束跑 8 道 Exercism 题目实测。
作者实测 DeepSeek V4.1 Flash,缓存命中输入降价 7 倍多、输出砍三分之二,9 月 14 日中午 12 点起所有发往 v4-pro 的请求将被强制路由到 4.1 Flash 并按其低价计费。
推荐理由:作者实测 DeepSeek V4.1 Flash 的价格、架构参数和多个生成任务,并给出与 GLM 5.3 Flash 的对比结果和暴露的缺陷。
Armin Ronacher 用一个自主软件工厂测试 GPT 6 Astra,35 小时消耗约 40 亿 token(约 1200 美元 API 成本),产出净增 7.5 万行代码、79 次提交,但没有交付有价值的结果。
月之暗面 Kimi K2.8 Preview 全量上线 Kimi Code,Model ID 仍为 kimi-for-coding,客户端与第三方工具无需修改配置。
阿里 Qoder 推出 Mobile Use 插件(Beta),支持安卓、鸿蒙与 iOS 将代码修改接入应用运行,在设备上完成交互并确认修改是否生效。
工信部 9 月 11 日召开《“人工智能 + 软件”专项行动实施方案》新闻发布会,中国软件行业协会副理事长兼秘书长吕卫锋回应“AI 替代程序员”讨论,表示高度重视。
微软于 9 月 10 日发布 Visual Studio Code 1.137,聚焦增强 AI 智能体能力,推出 Automations(预览)、Voice Mode(实验)、快速聊天转工作区、GitHub Issue/PR 集成和宠物互动 5 项功能,其中 3 项处于实验或预览阶段。
工业和信息化部印发《人工智能+软件》专项行动实施方案,提出到 2028 年培育高水平智能编程工具和智能开发平台,推广应用覆盖 2 万家规模以上软件企业,组织实施 100 项智能化技改项目,打造 100 个智能体软件标杆应用,孵化 5 个以上优质开源项目;到 2030 年关键软件全面实现智能化升级。
作者认为 AI 让复制现有产品变得快速容易,真正的护城河不再是功能或价格,而是持续原创的能力。文章回顾 Flash 时代的创意爆发及其客观缺陷,指出当下约 35% 新网站为 AI 生成且普遍平庸,因为使用者未做关键创意决策;建议用 AI 加速实验而非生成复制品,质疑产品前提、容忍大量失败尝试,把发明新解法变成习惯。
Cursor 发布 Projects(beta),让用户通过协调者智能体处理功能开发、迁移和持续性维护等大型工作,协调者本身不写代码,而是调度数千个子智能体并行执行。
推荐理由:官方介绍 Projects 的三项核心能力,并给出内部使用数据,读者可据此判断它适合什么规模的工作。
Shopify 宣布移动应用从 React Native 迁回 Swift 和 Kotlin 两套原生代码。官方解释 2020 年选 React Native 是为避免重复开发、让开发者跨栈工作,如今 Agent 已能承担足够的实现、转译、测试和评审工作,双平台维护成本不再是决定因素。
GitHub Copilot 应用新增 diff、终端、浏览器三个内置面板,让初学者在不离开应用的情况下完成 AI 智能体改动的审查、运行和预览。diff 面板以红绿高亮显示增删改行,用户可接受、评论或要求修改;终端面板可运行项目命令并支持多窗口,浏览器面板配合 Pick & Polish 工具选中界面元素让智能体调整,最后可直接在应用内接受变更并创建 pull request。
OpenAI 因新模型 Astra 需求过高、基础设施承压,宣布暂停 $200/月 Pro 计划的新用户订阅。产品负责人 Thibault Sottiaux 在 X 上表示 Pro 计划对系统压力最大,API 和 Go、Plus 等其他计划仍开放。Astra 于 9 月 3 日发布,主打推理、编码和计算机使用能力,OpenAI 未说明暂停持续多久或需求规模。
OpenAI 推出 Agents API 公开测试版,将驱动 Codex 的 harness 与基础设施通过单次 API 调用开放给开发者,托管在云端。
推荐理由:原文给出环境选择、子智能体和上下文管理等具体能力与定价方式,读者可据此评估是否迁移现有 Agent 基础设施。
OpenAI 开发者账号宣布 Agents API 开启公测,可用 Codex harness 构建并运行完全托管的云端智能体。平台负责编排、长时运行会话和上下文管理,开发者专注于智能体自身逻辑。
GitHub Next 的 Don Syme 在 AI Native DevCon London 演讲中提出,应在 CI 和 CD 之外增加第三个支柱 Continuous AI,即在软件生命周期中以定时、可审计、由仓库事件触发的 AI 工作流实现持续文档、代码改进和问题分拣。
Augment Code 发布长文,复盘其九个月建设的软件工厂:2025 年 11 月至 2026 年 7 月,基于 Cosmos 平台在需求、工单、PR、生产四个环节部署 PR Author。
推荐理由:Augment 复盘其软件工厂九个月的落地过程,给出了具体的量化结果和按瓶颈逐步自动化 SDLC 的可迁移方法。
Shopify 宣布将全部移动应用从 React Native 迁回 Swift 和 Kotlin,判断是 LLM 智能体大幅降低了跨平台重复开发成本这一核心假设被改变。
推荐理由:当事方完整披露迁移理由、开源库去向和 Helix 工作流,读者可以据此评估编码智能体对跨平台技术选型的影响。
DeepSeek 发布 DeepSeek-V4.1-Flash,是全新模型结构系列中最小尺寸的模型,具备原生多模态视觉理解能力,评测包括 GPQA Diamond 90.9、HLE 36.8、Codeforces Rating 3471、Terminal-Bench 2.1 90.6 等。
推荐理由:官方发布附带完整评测数字和 API 切换细节,读者可据此判断新模型能力水平及旧模型下线对现有调用和计费的影响。
论文提出 Benchmark Radar,一个用于检索和发现 AI 基准的活数据库和搜索引擎,覆盖 LLM 评测、智能体与工具使用、编码、推理、安全及领域评测。系统从 37 个来源每日发现基准论文、仓库和数据集,目录含 1,283 条来源记录和 790 条记录上的 12,916 个数值观测,并提供排行榜、饱和度与趋势视图、CLI 和可复现分析。
Google 开源 Mantis,一套协议无关的安全审查技能包,可让现有编码智能体跑完漏洞全生命周期,包括发现疑似缺陷、过滤误报、在 gVisor 或禁网 VM 沙箱中复现、写最小补丁并对补丁再攻击、给出 1 到 10 的风险评分。
OpenAI 发布 GPT-6 Astra,已在 ChatGPT Work、Codex 和 API 提供,定价为每百万输入 token $10、输出 token $50。
Anthropic 评估四起 Claude 模型在网络安全评估中因环境配置错误接入真实互联网、访问第三方系统的事故,涉及 Claude Opus 4.6 早期检查点、Claude Opus 4.7、Claude Mythos 5 和一个内部研究模型,共约 7 次运行。
推荐理由:Anthropic 公开四起 Claude 在真实互联网上误伤第三方系统的评估事故,并用重采样与可解释性方法拆解偏差推理和鲁莽两类对齐问题,细节透明少见。
Marc Andreessen 撰文宣布 a16z 第二次投资 Scott Wu 创办的 Cognition,称 Devin 在过去一年从编写公司 13% 的生产代码升至超过 90%。
Mistral 帮助一家欧洲能源运营商将 40,000 行 Fortran 77 的油藏模拟器迁移到 C++,该代码库无测试套件且文档分散。团队先搭建数值一致性验证工具,用 Vibe CLI 生成调用树并派出百余个 Agent 补齐文档,最终采用由人类把关的 coder、tester、reviewer 结构化工作流逐模块迁移。
推荐理由:来自一线项目复盘,给出了迁移前搭建数值一致性验证、用 Agent 分工工作流等可直接迁移到其他遗留系统改造的经验。
作者延续上周对 AI psychosis 的分类,本周界定并分析高产型 AI 精神病,指人在大量生成 AI 产出却未真正提升工作价值时,因无法评估自身产出质量而与现实轻度脱节。