跳到正文
原文
HuggingFace Daily Papers(社区热门论文)·· 2026-08-31AI 评分42

论文提出超越人类监督扩展大型推理模型的 L0-L4 路径框架

Scaling Large Reasoning Models beyond Human Supervision: A Path toward Superintelligence

AI 导读

论文研究大型推理模型(LRM)如何在人类监督逐渐退出学习回路后继续提升,提出从 L0 到 L4 的五级阶梯框架,覆盖奖励轴(从人工判断到无需人类反馈的可复用验证器)和经验轴(从人工策划任务到自生成课程与自主协同进化)。

整理与数据来源:AIHOT

来源:HuggingFace Daily Papers(社区热门论文) · arxiv.org