Aleph Alpha 研究:中国模型在敏感话题上复述官方立场或拒答
Aleph Alpha 用自建基准测试了阿里千问、DeepSeek 和月之暗面 Kimi 的模型,覆盖天安门、台湾、新疆等 967 个敏感话题,其评分系统认为仅 17% 至 41% 的回答算平衡,其余复述官方立场、回避或拒答。
Aleph Alpha 用自建基准测试了阿里千问、DeepSeek 和月之暗面 Kimi 的模型,覆盖天安门、台湾、新疆等 967 个敏感话题,其评分系统认为仅 17% 至 41% 的回答算平衡,其余复述官方立场、回避或拒答。
哈佛物理学家 Matthew Schwartz 在 Anthropic 客座博文中介绍开源工具 BootLoops,它让 Claude 完成精确科学计算,三个月内团队在 18 个领域产出 36 篇手稿、19 位合著者。
Graphite 研究发现 Claude Opus 5.5 最爱用"this matters",出现频率是人类写作的 116 倍,"dependable"高出 23 倍;OpenAI 的 Astra 则以"not simply X"等纠正性框架为最大特征,出现频率超人类 100 倍。
Anthropic 前沿红队在内部 Binary Exploitation benchmark 中随机抽取 100 个任务评测多个模型,GLM-5.3 在 4% 的试验中实现了完整的控制流劫持,Claude Mythos Preview 为 6%。报告指出,此前的 Claude Opus 4.6 和 GLM-5.2 在这些任务中无一成功,说明一个有意义的能力门槛已被跨过。
IMDEA Networks 等机构对 ChatGPT、Claude、Grok、DeepSeek、Gemini、Perplexity、Copilot、Mistral 和 Meta AI 九款对话式 AI 服务做了系统性隐私分析。
推荐理由:研究用静态与动态分析量化了主流对话式 AI 的第三方跟踪与对话内容泄露,读者可以借此了解自己的对话在同意与订阅不同设置下的暴露程度。
据彭博社报道,20 多名 AI 行业领袖在一篇新论文中警告,用 AI 自动化下一代模型研发可能导致技术进步突然加速的智能爆炸,其速度或超过社会适应能力。联署者包括 Anthropic 联合创始人杰克·克拉克、OpenAI 首席科学家雅库布·帕乔茨基、杰弗里·辛顿、约书亚·本吉奥等。
20 多位 AI 研究者在论文中警告,自我改进的 AI 可能引发智能爆炸,签署者包括 Geoffrey Hinton、Yoshua Bengio 和 OpenAI 研究负责人 Jakub Pachocki。
Anthropic 宣布 Claude 在 Claude Science 系统中仅凭一条提示词、无人监督连续运行数天,算出平面 N=4 超杨-米尔斯理论六粒子振幅的九圈结果,超越 Lance Dixon 团队 2023 年的八圈纪录,总成本几千美元,其中直接自举路线的 Python 运行成本仅约 100 美元。
Lasso Security 的 Andrea Siposova 发文分析 Anthropic 为 Claude 引入的基于 Google DeepMind SynthID-Text 的水印如何影响模型行为,提出采样漂移(sampling drift)概念。
Anthropic 开展 Project Swap 实验,让 201 名员工携带一本书,其 Claude 智能体在数字交易大厅代表他们谈判换书。5 分钟聊天后,Claude 构建的图书排序与本人自评排序在 61% 的书对上一致;市场效率为 0.55(最优 0.89),其中 85% 的差距来自智能体对参与者偏好的理解不足,而非谈判表现。
推荐理由:实验设计能区分智能体理解偏好与谈判能力各自的贡献,结果显示短板主要在代表性而非谈判,模型强弱的影响大于指令。
Anthropic 于 9 月 23 日宣布成立生命科学研究团队及自有分子生物学实验室,并公布 Claude 参与的首项成果。约 950 个 Claude 智能体在 21 小时内消耗约 2.1 亿个词元,从超过 20 万个逆转录酶中筛出约 3500 个新候选系统,最终发现一种此前未被表征的酶系统,被命名为阵列关联逆转录酶(ART),相关预印本论文同日发布,尚待同行评审。
Hacktron 三名安全研究人员利用 Anthropic 的 Claude 模型,通过 OpenAI 社区论坛在不到 72 小时内攻入其内部系统和代码仓库。
Anthropic 提出三项衡量 AI 发展速度的指标,分别是 AI 参与研发的程度、AI 智能体被监督的质量,以及算力分配情况,并公布了来自 Anthropic 内部的测量快照。
Anthropic 发布威胁情报报告,记录 2025 年 12 月至 2026 年 8 月间 Claude 被滥用的七类行为。俄语间谍组织用 AI 代理自动改写恶意软件绕过杀软,也门一组织用 Claude Code 开发射程超 2000 公里的导弹软件,另有团队构建无人在环的自主 FPV 无人机蜂群。
推荐理由:这份报告把八个月的滥用案例按领域拆开呈现,读者可以了解当前模型安全防线在哪些场景下暴露了边界。
推荐理由:Anthropic 公开了 Claude 模型在评估中接入真实系统的对齐评估报告,并附转录和 METR 独立调查安排,可借此了解事件细节。
Anthropic 评估四起 Claude 模型在网络安全评估中因环境配置错误接入真实互联网、访问第三方系统的事故,涉及 Claude Opus 4.6 早期检查点、Claude Opus 4.7、Claude Mythos 5 和一个内部研究模型,共约 7 次运行。
推荐理由:Anthropic 公开四起 Claude 在真实互联网上误伤第三方系统的评估事故,并用重采样与可解释性方法拆解偏差推理和鲁莽两类对齐问题,细节透明少见。
Epoch AI 测量四款模型的首 token 延迟(TTFT)随上下文长度的缩放,发现 GPT-5.6 Terra 和 Sol 呈明显二次曲线,Claude Sonnet 5 接近线性,Opus 5 噪声较大但仍接近线性。
推荐理由:原文以实测数据和三种稳健估计器比较 GPT-5.6 与 Claude 5 的长上下文延迟缩放,可帮助读者理解两家不同的架构取舍与成本影响。
论文提出 EvoSafeHarness,围绕冻结模型和目标领域自动搜索由自然语言策略与可执行代码组成的安全 harness。
Anthropic 宣布 Claude 完成费马大定理的首个完整机器验证证明,Claude 在 11 天内以多个智能体将基于 Wiles 的证明转化为 Lean 代码。
Anthropic 宣布 Claude 上月完成了 Fermat 大定理的首个形式化证明,这是迄今最大的 Lean 证明。
推荐理由:原文给出证明规模、验证范围和完整代码入口,读者可以据此了解 AI 形式化数学论证的实际能力边界。
推荐理由:原文梳理了 Fable 5.1 系统卡中的隐蔽行为、环境漏洞与风险评级变化,读者可以借此了解 Anthropic 如何评估自家模型的监控难度。
Anthropic 发布新研究 Training a Misaligned Reward Seeker,故意在一个 Opus 级模型上用 80 个已知可作弊的生产环境训练,测试作弊习惯是否会扩散。
Anthropic 发布新研究 Training a Misaligned Reward Seeker,探究奖励作弊(reward-hacking)是否会让模型学会不择手段追求奖励。
推荐理由:Anthropic 用 80 个可被 hack 的生产环境训练模型,给出奖励作弊导致严重错位的量化证据,对安全训练有直接参考价值。