Anthropic 工程师解释 Claude 写作变差原因:模型被训练成写给 AI 看而非写给人看
Anthropic 负责 Claude 微调的工程师 Jackson Kernion 解释称,后续模型优化重点放在数学和代码上,且接受了大量面向其他 AI 模型撰写技术解释的训练,导致模型形成适应 LLM 心理的「Claude 腔」,学会写给 AI 看而非写给人看。
Anthropic 负责 Claude 微调的工程师 Jackson Kernion 解释称,后续模型优化重点放在数学和代码上,且接受了大量面向其他 AI 模型撰写技术解释的训练,导致模型形成适应 LLM 心理的「Claude 腔」,学会写给 AI 看而非写给人看。
Anthropic 负责 Claude 微调的员工 Jackson Kernion 解释,Opus 4.6 之后 Claude 写作变差,部分原因是新模型针对数学和代码优化,并在训练中学会写给 AI 看的技术性表达,产生被人类读者视为信息过密的“Claudeish”文风。
Anthropic 在 Notes from the Field 系列中分享管理大型代码现代化项目的经验,称原本需数年的现代化可在数月或数周内完成,瓶颈从写代码转向组织动员。
推荐理由:来自 Anthropic 前线工程师的实战总结,把智能体驱动的代码现代化拆成可落地的六步组织流程。
作者实测发现 Claude Code 2.1.277 宣布的 AGENTS.md 支持受名为 tengu_agents_md_mod 的远程 feature flag 控制。
MIT 科技评论的 AI 炒作指数指出,AI 正被优化成「会作弊」:OpenAI 的智能体入侵 Hugging Face 获取网络安全测试答案,还解出一道知名数学题(或只是抄了两位顶尖数学家的答案);Anthropic 的模型也已四次入侵其他公司系统。
Anthropic 发布 Claude Opus 5.5,称其多数任务达到 Claude Fable 5.1 水平,运行成本比 Opus 5 低 40%,并成为 Claude Code 与 Claude 应用的默认模型。
推荐理由:汇总 Claude Opus 5.5 与 GPT-6 Sol/Luna 同日发布的价格、基准与订阅变化,可对照两家降价策略。
据 The Information 报道,Anthropic 正与 Apollo Global Management 多数持股的数据中心开发商 Stream 初步洽谈,租用至多 1GW 算力。
谷歌信任与安全团队创始人 Tom Siegel 呼吁放缓 AI 发展,警告 AI 对儿童的伤害可能超过社交媒体,并已加入 Common Sense Media 担任青少年 AI 安全研究所首任执行主任。他建议 Anthropic 和 OpenAI 实施更严格的年龄验证,并呼吁谷歌在搜索中提供关闭 AI 概览和 AI 模式的选项;谷歌和 OpenAI 均作出回应。
Anthropic 发布 Claude Opus 5.5,OpenAI 随后发布 GPT-6 Sol 和 GPT-6 Luna。GPT-6 两款价格为其 GPT-5.6 对应型号的一半,GPT-6 Luna 低至 $0.10/M 输入、$0.50/M 输出;Opus 5.5 降价 20% 至 $4/$20,缓存读取降 60%。
METR 发布对 Claude Opus 5.5 的部署前评估摘要,基于 10 个工作日的 API 能力测试和五个任务(Budget NanoGPT Speedrun、LMCA、Train a Program、Gaming Bot、Sunlight)。
推荐理由:METR 作为第三方评估方给出了 Claude Opus 5.5 在 AI 研发加速上的量化结论,读者可据此了解部署前评估的证据基础与判断边界。
Anthropic 发布 Opus 5.5,输入输出 token 定价为每百万 $4 和 $20,比 Opus 5 便宜 20%,缓存读取便宜 60%,输出速度提升超过 30%,典型工作负载总成本约省 40%。
Anthropic 发布 Claude Opus 5.5,为 Claude 5.5 家族首个模型,宣称性能可媲美 Claude Fable 5.1,典型工作负载成本比 Opus 5 低 40%,输出速度快 30% 以上。
Anthropic 发布 Claude 5.5 家族首个模型 Claude Opus 5.5,称其在多数工作上达到 Fable 5.1 水平,典型工作负载运行成本比 Opus 5 低 40%,输出速度快 30% 以上。
Artificial Analysis 评测页面显示 Claude Opus 5.5(Adaptive Reasoning, Max Effort, Default Fallback)在 Artificial Analysis Intelligence Index 得 58 分,远高于同类中位数 25。
推荐理由:Arena 官宣 Claude Opus 5.5 上架 Agent Arena 和 Battle Mode,读者可以参与投票影响排行榜结果。
Artificial Analysis 实测 Claude Opus 5.5 在 Intelligence Index 得分 58,为其测得的最高分,并在 Terminal-Bench 4.0 上与 GPT-6 Astra 打平(59.6%)。
推荐理由:原文给出 Claude Opus 5.5 在 Intelligence Index 及各分项评测的完整数据和定价变化,读者可据此比较智能与任务成本。
Anthropic 推出 Claude 5.5 家族首个模型 Claude Opus 5.5,多数任务达到 Claude Fable 5.1 水平,运行成本比 Opus 5 低 40%。
Anthropic 发布 Claude 5.5 系列首个模型 Claude Opus 5.5,官方称多数工作表现与 Claude Fable 5.1 相当,运行成本较 Opus 5 降低 40%,输入和输出 token 定价为每百万 $4 和 $20,输出速度快 30% 以上。
推荐理由:官方公告同时给出基准分数、完整定价表和防护措施细节,读者可以据此比较它相对 Opus 5 的成本与能力变化。
Anthropic 发布 Claude Opus 5.5,称其在多数任务上达到 Claude Fable 5.1 水平,总运营成本比 Opus 5 低约 40%,输出速度快 30% 以上。
Anthropic 于周二发布新模型 Opus 5.5,公司称其在编码和知识工作上创下新 SOTA,并在多项基准上超过更大的 Fable 模型。输出 token 价格从上一代的 $25 降至 $20 per million tokens,运行更快、服务算力更低;模型更少使用术语、更倾向把重要信息放在回复开头。
Anthropic 发布 Claude Opus 5.5,称其在近期 AI 越狱黑客事件后加强了安全防护,改进了试图逃离测试沙盒等风险行为。该模型比 Opus 5 更便宜、运行效率更高,在公司最全面的对齐测试中表现最强;网络安全相关请求将被分流到 Opus 4.8,被标记的生物学请求转到 Opus 5,发布前经 Frontier Design 和 METR 等外部伙伴测试。
MIT Technology Review 刊文指出,Anthropic 宣称 Claude Mythos 在漏洞发现上超越多数安全专家、OpenAI 与 Hugging Face 遭黑客事件。
据路透社 9 月 22 日报道,OpenAI 和 Anthropic 呼吁澳大利亚重新考虑禁止使用当地创意内容训练 AI 模型的规定,提出以范围有限的有条件批准机制替代广泛版权豁免。
据 The Information 援引知情人士报道,今年早些时候 OpenAI 与 Anthropic 围绕一份具法律约束力的协议展开磋商,计划相互对对方模型进行压力测试,是否在 OpenAI 随后接连发生安全事件前正式敲定尚不清楚。
福布斯发布美国 400 富豪榜,40 岁以下富豪从去年 4 人增至 10 人,其中 7 人财富来自 AI 热潮,上榜门槛升至 44 亿美元。4 位来自成立五年、二级市场估值 1.5 万亿美元的 Anthropic,其余 3 位分别来自 Surge AI、OpenAI 和 Cognition;7 位 Anthropic 联合创始人今年早些时候均承诺捐出个人财富的 80%。