跳到正文

#编码

今日 1 条
9月11日周五
  1. Hacker News 热门(buzzing.cc 中文翻译)58

    AI 正在破坏职场信任:一位工程师对代码评审的反思

    工程师 matheusml 撰文称,AI 让人无需理解就能生成代码、文档和评审回复,动摇了“署名即代表理解”的职场信任默认。他说自己评审时的问题已从“这个改动好吗”变成“作者是否理解自己提交的内容”,并坦承自己也曾合并过未理解的 AI 修复。文末给出建议:工程师发送前先读懂并精简自己的 diff,负责人则应明确“可评审”标准、允许坦承未验证的工作并以身作则。

  2. 公众号:卡尔的AI沃茨76

    实测 DeepSeek V4.1 Flash:价格大降、原生带视觉,作者用游戏与城市生成任务验证表现

    作者实测 DeepSeek V4.1 Flash,缓存命中输入降价 7 倍多、输出砍三分之二,9 月 14 日中午 12 点起所有发往 v4-pro 的请求将被强制路由到 4.1 Flash 并按其低价计费。

    推荐理由:作者实测 DeepSeek V4.1 Flash 的价格、架构参数和多个生成任务,并给出与 GLM 5.3 Flash 的对比结果和暴露的缺陷。

  3. IT之家(RSS)64

    工信部印发《人工智能+软件》专项行动实施方案:2028 年推广至 2 万家规上软件企业、打造 100 个智能体软件标杆应用

    工业和信息化部印发《人工智能+软件》专项行动实施方案,提出到 2028 年培育高水平智能编程工具和智能开发平台,推广应用覆盖 2 万家规模以上软件企业,组织实施 100 项智能化技改项目,打造 100 个智能体软件标杆应用,孵化 5 个以上优质开源项目;到 2030 年关键软件全面实现智能化升级。

  4. Hacker News 热门(buzzing.cc 中文翻译)55

    创造力是新的护城河:从 Flash 时代看 AI 时代的差异化

    作者认为 AI 让复制现有产品变得快速容易,真正的护城河不再是功能或价格,而是持续原创的能力。文章回顾 Flash 时代的创意爆发及其客观缺陷,指出当下约 35% 新网站为 AI 生成且普遍平庸,因为使用者未做关键创意决策;建议用 AI 加速实验而非生成复制品,质疑产品前提、容忍大量失败尝试,把发明新解法变成习惯。

  5. Cursor Blog78

    Cursor 推出 Projects:协调者智能体管理数千个子智能体处理大型开发任务

    Cursor 发布 Projects(beta),让用户通过协调者智能体处理功能开发、迁移和持续性维护等大型工作,协调者本身不写代码,而是调度数千个子智能体并行执行。

    推荐理由:官方介绍 Projects 的三项核心能力,并给出内部使用数据,读者可据此判断它适合什么规模的工作。

  6. GitHub Blog53

    GitHub Copilot 应用入门教程:用 diff、终端和浏览器面板审查 AI 代码

    GitHub Copilot 应用新增 diff、终端、浏览器三个内置面板,让初学者在不离开应用的情况下完成 AI 智能体改动的审查、运行和预览。diff 面板以红绿高亮显示增删改行,用户可接受、评论或要求修改;终端面板可运行项目命令并支持多窗口,浏览器面板配合 Pick & Polish 工具选中界面元素让智能体调整,最后可直接在应用内接受变更并创建 pull request。

  7. TechCrunch:AI(RSS)65

    OpenAI 因 Astra 需求过高暂停 $200/月 Pro 订阅

    OpenAI 因新模型 Astra 需求过高、基础设施承压,宣布暂停 $200/月 Pro 计划的新用户订阅。产品负责人 Thibault Sottiaux 在 X 上表示 Pro 计划对系统压力最大,API 和 Go、Plus 等其他计划仍开放。Astra 于 9 月 3 日发布,主打推理、编码和计算机使用能力,OpenAI 未说明暂停持续多久或需求规模。

  8. OpenAI:官网动态(RSS · 排除企业/客户案例)81

    OpenAI 发布 Agents API 公测版

    OpenAI 推出 Agents API 公开测试版,将驱动 Codex 的 harness 与基础设施通过单次 API 调用开放给开发者,托管在云端。

    推荐理由:原文给出环境选择、子智能体和上下文管理等具体能力与定价方式,读者可据此评估是否迁移现有 Agent 基础设施。

9月10日周四
  1. Hacker News 热门(buzzing.cc 中文翻译)81

    Shopify 宣布从 React Native 全面迁回 Swift 和 Kotlin 原生开发

    Shopify 宣布将全部移动应用从 React Native 迁回 Swift 和 Kotlin,判断是 LLM 智能体大幅降低了跨平台重复开发成本这一核心假设被改变。

    推荐理由:当事方完整披露迁移理由、开源库去向和 Helix 工作流,读者可以据此评估编码智能体对跨平台技术选型的影响。

  2. DeepSeek:API 更新日志80

    DeepSeek 发布 V4.1-Flash,API 价格同步下调

    DeepSeek 发布 DeepSeek-V4.1-Flash,是全新模型结构系列中最小尺寸的模型,具备原生多模态视觉理解能力,评测包括 GPQA Diamond 90.9、HLE 36.8、Codeforces Rating 3471、Terminal-Bench 2.1 90.6 等。

    推荐理由:官方发布附带完整评测数字和 API 切换细节,读者可据此判断新模型能力水平及旧模型下线对现有调用和计费的影响。

  3. HuggingFace Daily Papers(社区热门论文)55

    Benchmark Radar:AI 基准与评测的活数据库和搜索引擎

    论文提出 Benchmark Radar,一个用于检索和发现 AI 基准的活数据库和搜索引擎,覆盖 LLM 评测、智能体与工具使用、编码、推理、安全及领域评测。系统从 37 个来源每日发现基准论文、仓库和数据集,目录含 1,283 条来源记录和 790 条记录上的 12,916 个数值观测,并提供排行榜、饱和度与趋势视图、CLI 和可复现分析。

  4. Anthropic:Research(发表成果 · 网页)83

    Anthropic 发布四起 Claude 网络安全评估事故的对齐评估报告

    Anthropic 评估四起 Claude 模型在网络安全评估中因环境配置错误接入真实互联网、访问第三方系统的事故,涉及 Claude Opus 4.6 早期检查点、Claude Opus 4.7、Claude Mythos 5 和一个内部研究模型,共约 7 次运行。

    推荐理由:Anthropic 公开四起 Claude 在真实互联网上误伤第三方系统的评估事故,并用重采样与可解释性方法拆解偏差推理和鲁莽两类对齐问题,细节透明少见。

  5. Mistral AI:News(网页)63

    Mistral 复盘用 AI Agent 将 40,000 行 Fortran 77 迁移到 C++ 的方法与教训

    Mistral 帮助一家欧洲能源运营商将 40,000 行 Fortran 77 的油藏模拟器迁移到 C++,该代码库无测试套件且文档分散。团队先搭建数值一致性验证工具,用 Vibe CLI 生成调用树并派出百余个 Agent 补齐文档,最终采用由人类把关的 coder、tester、reviewer 结构化工作流逐模块迁移。

    推荐理由:来自一线项目复盘,给出了迁移前搭建数值一致性验证、用 Agent 分工工作流等可直接迁移到其他遗留系统改造的经验。