OpenAI 征集 Codex Originals 用户故事
OpenAI 启动 Codex Originals 项目征集,面向使用 Codex 的开发者、研究者和创作者收集真实故事与项目。参与者需提交个人背景、项目介绍及相关链接,入选者将参与该项目的下一阶段。
OpenAI 启动 Codex Originals 项目征集,面向使用 Codex 的开发者、研究者和创作者收集真实故事与项目。参与者需提交个人背景、项目介绍及相关链接,入选者将参与该项目的下一阶段。
Databricks 分享其让全部员工在模型发布首日即可试用新模型的内部流程,依托 Unity Gateway 做配置分发、治理与可观测性。流程分三步:立即以实验标签开放新模型、用四类按人预算控制成本、再依据内部基准、用户反馈和 OpenTelemetry 成本追踪决定推广或下线。
推荐理由:Databricks 以自家 12000 名员工的实际 rollout 为例,给出可复用的新模型评估、预算分层与成本度量方法。
Claude Sonnet 5.5 现已在 Google Cloud 上线,面向编程与知识工作场景。官方称其能以更低单任务成本、更快速度帮助构建功能并产出规范的工作材料。
Anthropic 的 Claude Sonnet 5.5 上线 OpenRouter。原文称其明显比 Sonnet 5 更聪明、写作更清晰,且对多数工作负载快约 30%、便宜约 30%。
AWS 宣布 Claude Sonnet 5.5 在 Amazon Bedrock 和 Claude Platform on AWS 上线,定位为面向编码与知识工作的更高效 Sonnet 模型,多数任务单任务成本更低、速度更快。
推荐理由:AWS 官方给出 Sonnet 5.5 的定位、与 Opus 5.5 的分工以及 Bedrock 上的调用方式,便于判断何时选用。
Anthropic 发布 Claude Sonnet 5.5,输出速度提升超过 30%,因每任务消耗 token 更少,有效成本最多降低 30%,多项基准接近 Opus 5.5。
Anthropic 发布中端模型 Sonnet 5.5,官方称其比前代 Sonnet 5 快 30%,token 消耗明显更低。公司基准显示该模型在 agentic 编码上优于 Opus 5.5,并称其具备与 Opus 5 相当的网络安全能力,因此成为首个适用与 Fable 和 Opus 相同网络安全防护的 Sonnet 模型;公司还计划在未来几周发布新版本 Haiku。
Anthropic 发布 Claude Sonnet 5.5,为 Claude 5.5 家族第二款模型,生成速度比 Sonnet 5 快 30% 以上,每任务成本最多低 30%,定价维持每百万输入 token $2、输出 $10、缓存读取 $0.20。
Anthropic 发布 Claude Sonnet 5.5,运行速度比 Sonnet 5 快 30% 以上,写作更清晰,适合快速来回交互。定位上与为复杂判断工作打造的 Claude Opus 5.5 区分,Sonnet 5.5 擅长范围明确的日常任务、修复 bug 以及制作文档、幻灯片和表格。模型即日起全量可用,Claude Haiku 5.5 将在未来几周加入该系列。
有开发者指出,AI 生成的代码或许只是平均水平,真正的危机是团队里没人再了解系统架构和当初的设计意图,所有人遇到问题只会去问 Claude。有工程师描述在大公司任职半个月的见闻:规格、代码、测试、PRD、工单乃至报告全部由 Claude Code 生成,从 L1 到 L7 的工程师都在做同一件事——和 Claude 对话,没人读代码,也没人真正在思考。
Meta 推出 Meta Enterprise Platform,向企业出售 AI 工具,首批包括 Muse agent、Meta Business Agent、Muse API 和 Muse Code,由前 MongoDB CEO Chirantan Desai 领导并直接向 Mark Zuckerberg 汇报。
The Verge Decoder 播客专访 Atlassian 联合创始人兼 CEO Mike Cannon-Brookes,讨论所谓 SaaSpocalypse 是否成立。
资深工程师 Alex Ewerlof 发文反驳'编程已解决、工程只看品味'的说法,指出维护、可靠性、安全等 NFR 以及功能需求本身都未解决,AI 无法承担问责。文章列举 LLM 擅长的场景如 POC、个人软件、自然语言转换,并逐条批驳'spec 即代码''英语是新编程语言''Agent 是新编译器'等流行观点,还与 DHH 展开交锋,最后建议工程师保持理解与问责,警惕 AI 过度使用。
Anthropic 官方文档介绍针对 Claude Opus 5.5 的提示词模式,覆盖 effort 校准、无人值守智能体运行、安全拒绝、进度更新、多应用工作流、视觉输入和前端设计等场景。
推荐理由:官方文档梳理了从 Claude Opus 5 迁移到 5.5 时的具体提示词与 harness 调整点,可直接对照排查现有集成的问题。
UC Berkeley 团队构建全自动 AI Agent 审计 13 个广泛使用的基准,发现 45 个作弊方案,全部基准被评为 critical 风险,共归纳 16 种攻击类型。
推荐理由:原文给出了13个常用基准的45个作弊方案细节和防范设计原则,读者可以据此检查自己依赖的评测是否可信。
智谱 ZCode 在被质疑偷传代码后宣布开源,并发布公告称仓库快照上传链路已移除、涉事云端数据已删除,承诺“你不发起,不上云”,开源版本更新至 3.14.3。补偿方面,付费用户获赠 4 张周重置卡和 4 张 5 小时重置卡(1 个月内有效),9 月 28 日至 10 月 7 日期间向全体用户赠送共 10 万份 1 亿 Token 额度。
新智元转述多位开发者在 X 上的爆料称,Claude Sonnet 5.5 已出现在 Anthropic 官方配置中,标识符为「claude-sonnet-5-5」,并在 Claude Code 中开启灰度测试。
BestBlogs 早报 09-28 精讲三篇:José Valim 提出围绕智能体重新审视编程语言应提供的程序保证与可查询接口,并建议把符号、调用图和类型暴露成程序数据库。
Simon Willison 在 WeAreDevelopers World Congress North America 发表闭幕主题演讲,以时间线梳理 2026 年 LLM 领域的主要趋势。
SkillGym 框架将人类编写的技能转化为 2,756 个带代码检查器的训练环境,并在 8,364 条成功轨迹上微调。
作者评论 TypeSafe AI 推出的 AI 模型 Jev,认为其用户不做 evals、把置信度分数当形式或甩锅理由,丢弃了对失败原因的追查。他担忧 LLM 驱动的开发会让"有时就是烂"成为排查的可接受终点,而本可用几条提示词搭建的 eval 反而能解决部分问题。
Synthetic Sciences 发布开源科研 Agent OpenScience,正式结束 beta 并上线 Product Hunt,采用 Apache 2.0 许可、免费开放。
作者吐槽自己大学应用更新后的界面是典型的 AI slop UI,并总结十个识别迹象:无处不在的渐变和紫色、无意义的彩色、多余的脉冲徽章、被滥用的指甲卡片、大量 emoji、元素错位、Inter 或 JetBrains Mono 字体、聊天上下文带来的冗余文案、glassmorphism,以及 Elevate、Seamless、Next-Generation 之类的空洞口号。
HuggingFace 上开源了一个用 Claude Opus 5.5 生成的模拟医患对话数据集,覆盖 2194 种疾病,平均每段 33 轮,从症状、检查聊到治疗和后续安排。