HuggingFace Daily Papers(社区热门论文)·· 2026-08-31AI 评分42
论文提出超越人类监督扩展大型推理模型的 L0-L4 路径框架
Scaling Large Reasoning Models beyond Human Supervision: A Path toward Superintelligence
AI 导读
论文研究大型推理模型(LRM)如何在人类监督逐渐退出学习回路后继续提升,提出从 L0 到 L4 的五级阶梯框架,覆盖奖励轴(从人工判断到无需人类反馈的可复用验证器)和经验轴(从人工策划任务到自生成课程与自主协同进化)。
整理与数据来源:AIHOT
来源:HuggingFace Daily Papers(社区热门论文) · arxiv.org