OpenAI:官网动态(RSS · 排除企业/客户案例)·· 2026-09-06精选AI 评分72
OpenAI 长文阐述对齐与监测困境,称 CoT 监控能力正在减弱
An Alien Mind
AI 导读
OpenAI 发布长文《An Alien Mind》,回溯 2023 年 RLSlow 项目中确认推理模型可扩展训练的起点,并系统阐述目标对齐与价值对齐的区分。文章指出链式思维监控的效果正随着模型能力提升而逐步减弱,GPT‑6 Astra 在对齐上显著优于 GPT‑5.6 Sol;作者预期进展可能持续走向机器递归自我改进(RSI),呼吁自愿放缓扩展、建立第三方安全门槛并加强国际协调。
推荐理由
作者以内部视角回溯推理模型的起源,并给出对齐监测、CoT 监控弱化和 RSI 风险的一手判断。
整理与数据来源:AIHOT
来源:OpenAI:官网动态(RSS · 排除企业/客户案例) · openai.com