跳到正文

#编码

今日 0 条
9月29日周二
  1. OpenAI:官网动态(RSS · 排除企业/客户案例)14

    OpenAI 征集 Codex Originals 用户故事

    OpenAI 启动 Codex Originals 项目征集,面向使用 Codex 的开发者、研究者和创作者收集真实故事与项目。参与者需提交个人背景、项目介绍及相关链接,入选者将参与该项目的下一阶段。

  2. Databricks:Blog(RSS)65

    Databricks 如何让 12000 名员工在模型发布首日用上新前沿模型

    Databricks 分享其让全部员工在模型发布首日即可试用新模型的内部流程,依托 Unity Gateway 做配置分发、治理与可观测性。流程分三步:立即以实验标签开放新模型、用四类按人预算控制成本、再依据内部基准、用户反馈和 OpenTelemetry 成本追踪决定推广或下线。

    推荐理由:Databricks 以自家 12000 名员工的实际 rollout 为例,给出可复用的新模型评估、预算分层与成本度量方法。

  3. TechCrunch:AI(RSS)71

    Anthropic 发布 Sonnet 5.5,称其比前代更快更便宜

    Anthropic 发布中端模型 Sonnet 5.5,官方称其比前代 Sonnet 5 快 30%,token 消耗明显更低。公司基准显示该模型在 agentic 编码上优于 Opus 5.5,并称其具备与 Opus 5 相当的网络安全能力,因此成为首个适用与 Fable 和 Opus 相同网络安全防护的 Sonnet 模型;公司还计划在未来几周发布新版本 Haiku。

  4. Claude:YouTube(RSS)67

    Anthropic 发布 Claude Sonnet 5.5,速度比 Sonnet 5 快超 30%

    Anthropic 发布 Claude Sonnet 5.5,运行速度比 Sonnet 5 快 30% 以上,写作更清晰,适合快速来回交互。定位上与为复杂判断工作打造的 Claude Opus 5.5 区分,Sonnet 5.5 擅长范围明确的日常任务、修复 bug 以及制作文档、幻灯片和表格。模型即日起全量可用,Claude Haiku 5.5 将在未来几周加入该系列。

  5. Hacker News:AI 热帖48

    AI 写代码不是问题,没人懂系统架构和意图才是

    有开发者指出,AI 生成的代码或许只是平均水平,真正的危机是团队里没人再了解系统架构和当初的设计意图,所有人遇到问题只会去问 Claude。有工程师描述在大公司任职半个月的见闻:规格、代码、测试、PRD、工单乃至报告全部由 Claude Code 生成,从 L1 到 L7 的工程师都在做同一件事——和 Claude 对话,没人读代码,也没人真正在思考。

  6. elvis52

    Base44(@Base44)发布 Base Code 早期预览版,将代码仓库扫描后把数据库、Redis 等基础设施组件全部搭建到云端,供团队在统一环境中协作开发,支持从任意浏览器访问,WhatsApp / iMessage 接入即将推出。该环境还可支撑自动化软件工厂等能力,如智能体读取支持工单、实现修改并在云端验证。产品与模型无关,免费开放 30 天,可连接任意 GitHub 仓库获取实时预览。

9月28日周一
  1. François Chollet44

    Francois Chollet 表示自己如今不再读写代码,只通过 LRM 下指令,但这并非因为 LRM 代码质量已完美甚至够好。他认为 LRM 能解锁测试代码库、审计组件、生成可视化、红队测试等新工作流,速度远超以往,这些方式能达到与阅读代码相当的理解效果。因此手写代码的 ROI 已不再划算,原因不是 LRM 变完美,而是其速度足以支撑更高效的新工作流。

  2. Hacker News 热门(buzzing.cc 中文翻译)60

    资深工程师撰文反驳'编程已被AI解决'的叙事

    资深工程师 Alex Ewerlof 发文反驳'编程已解决、工程只看品味'的说法,指出维护、可靠性、安全等 NFR 以及功能需求本身都未解决,AI 无法承担问责。文章列举 LLM 擅长的场景如 POC、个人软件、自然语言转换,并逐条批驳'spec 即代码''英语是新编程语言''Agent 是新编译器'等流行观点,还与 DHH 展开交锋,最后建议工程师保持理解与问责,警惕 AI 过度使用。

  3. Hacker News:AI 热帖86

    Claude Opus 5.5 提示词指南:与 Opus 5 的行为差异及迁移模式

    Anthropic 官方文档介绍针对 Claude Opus 5.5 的提示词模式,覆盖 effort 校准、无人值守智能体运行、安全拒绝、进度更新、多应用工作流、视觉输入和前端设计等场景。

    推荐理由:官方文档梳理了从 Claude Opus 5 迁移到 5.5 时的具体提示词与 harness 调整点,可直接对照排查现有集成的问题。

  4. Berkeley RDI:Blog(AI 安全与评测)75

    UC Berkeley 团队用 AI Agent 审计 13 个基准,发现 45 个无需解题的满分作弊方案

    UC Berkeley 团队构建全自动 AI Agent 审计 13 个广泛使用的基准,发现 45 个作弊方案,全部基准被评为 critical 风险,共归纳 16 种攻击类型。

    推荐理由:原文给出了13个常用基准的45个作弊方案细节和防范设计原则,读者可以据此检查自己依赖的评测是否可信。

  5. IT之家(RSS)64

    智谱 ZCode 宣布删除涉事云端数据,赠送重置卡和 1 亿 Token

    智谱 ZCode 在被质疑偷传代码后宣布开源,并发布公告称仓库快照上传链路已移除、涉事云端数据已删除,承诺“你不发起,不上云”,开源版本更新至 3.14.3。补偿方面,付费用户获赠 4 张周重置卡和 4 张 5 小时重置卡(1 个月内有效),9 月 28 日至 10 月 7 日期间向全体用户赠送共 10 万份 1 亿 Token 额度。

  6. Hacker News 热门(buzzing.cc 中文翻译)54

    Jev 与无法解释的失败的常态化

    作者评论 TypeSafe AI 推出的 AI 模型 Jev,认为其用户不做 evals、把置信度分数当形式或甩锅理由,丢弃了对失败原因的追查。他担忧 LLM 驱动的开发会让"有时就是烂"成为排查的可接受终点,而本可用几条提示词搭建的 eval 反而能解决部分问题。

  7. Hacker News 热门(buzzing.cc 中文翻译)52

    粗制滥造的用户界面的10个迹象:作者盘点AI生成UI的典型槽点

    作者吐槽自己大学应用更新后的界面是典型的 AI slop UI,并总结十个识别迹象:无处不在的渐变和紫色、无意义的彩色、多余的脉冲徽章、被滥用的指甲卡片、大量 emoji、元素错位、Inter 或 JetBrains Mono 字体、聊天上下文带来的冗余文案、glassmorphism,以及 Elevate、Seamless、Next-Generation 之类的空洞口号。

9月27日周日