跳到正文

#推理

今日 0 条
10月7日周三
10月2日周五
  1. Ars Technica · AI60

    CMU 等团队用 16 块 GPU 训练 AI 在 Stratego 上击败顶尖人类选手

    卡内基梅隆、MIT、纽约大学和斯坦福的研究团队开发出 AI 系统 Ataraxos,在 Stratego 上以 15 胜 1 负 4 平击败被视为史上最强的选手 Pim Niemeijer。Stratego 是信息不完全游戏,棋子身份只在碰撞时揭示,此前连 DeepMind 也未能造出稳定击败顶尖人类玩家的机器。该研究仅用 16 块 GPU 和数千美元完成训练。

9月30日周三
  1. HuggingFace Daily Papers(社区热门论文)42

    AI Night-Scientist:用强化学习训练 LLM 的智能体科研创意

    AI Night-Scientist 是一个用强化学习教模型何时以及如何跳出可预测推理的智能体框架,基于行动、过程、结果三个维度用 GRPO 训练。相比基座模型,其科研提案的研究方向范围扩大 27.8%、贡献类型增加 14.9%,预测引用影响最高提升 32.0 个百分点,原创性提升 66.2 分。仅提高解码温度无法复现这些增益,指明追求何种创造力的语义引导才是关键。

9月29日周二
  1. HuggingFace Daily Papers(社区热门论文)38

    SCOPD:面向高效视觉语言模型的稀疏上下文同策略自蒸馏

    针对推理型视觉语言模型(VLM)视觉 token 序列过长导致推理昂贵的问题,研究者提出稀疏上下文同策略自蒸馏框架 SCOPD:学生模型基于剪枝后的视觉 token 生成推理轨迹,由拥有完整上下文的教师模型对同一同策略前缀进行监督,无需真实答案、架构改动或额外推理开销。

  2. Apple Machine Learning Research(RSS)42

    苹果研究:语言模型树结构表达式序列化的通信瓶颈与往返研究

    苹果研究者提出往返协议,用生成器把算术表达式转成文字题、再由独立提取器还原,并以符号等价作为精确判定,测试十六个模型的所有两两组合。结果显示该通道有损且不对称:交换生成与提取模型可使准确率相差最多 60.4 个百分点,最佳组合达 92.9%;至少 73.6% 的失败源于生成端,难度由树结构而非模型家族决定。

  3. HuggingFace Daily Papers(社区热门论文)44

    蒸馏防御在强化学习后轻易失效

    论文指出,现有蒸馏攻击防御通常只在蒸馏后立即评估,隐含假设攻击者不再继续训练,但更现实的威胁模型包含蒸馏后的强化学习。结果显示,强化学习会降低蒸馏攻击门槛,仅用当前 API 易得数据即可窃取闭源模型推理能力,效果相当于提取完整隐藏推理轨迹的复杂攻击。任何泄露足够信息以重建近似推理轨迹的蒸馏防御都可能失效。

  4. Dongxi 东锡 NLP46

    You Only Edit Once: 通过局部示例精修激发 LLM 的上下文能力 挑选最佳少样本示例是一种缓慢的 System-2 搜索:组合爆炸,且往往需要反复调用 LLM。 我们把它变成了 System 1。⚡ Jev-LDE,一个 1.7B 的编辑器,扫一眼检索到的示例,只做一次编辑。LLM 只回答一次。 平均 1-shot 准确率 81.2 → 88.1 You Only Edit Once 🧵 动画演示(示意示例)。查询:“How far is it from Denver to Aspen?” 语义 TopK 检索出三个相似示例:“Where is Aspen, Colorado?”(Location)、“What state is Denver in?”(Location)、“Who founded Denver?”(Person)。Jev-LDE,一个 1.7B 的 System-1 编辑器,标记出第一个虽然主题相同但答案类型错误,并输出一个动作:将 S1 替换为候选 C1,“How far is Boston from NYC?”(Number)。冻结的目标 LLM 随后回答“Number”,这是正确的;若不编辑,它会回答“Location”。结尾卡片:在 3 个基准和 4 个目标 LLM 上,平均 1-shot 准确率从 81.2 提升至 88.1,在 48 个设置中有 44 个达到最佳或并列最佳,墙钟时间增加 11%。

  5. HuggingFace Daily Papers(社区热门论文)48

    为何确定性 PRM 引导在离散扩散推理中表现不佳

    研究显示,在同等前向计算预算下,确定性 PRM 引导的离散扩散语言模型推理不如独立采样加 ORM 重排。在 Dream-v0-Instruct-7B 上,GSM8K 每题 8 个候选时前者准确率 65.18%,后者达 75.13%,32 个候选时差距扩大到 12.69 个百分点。作者将其归因于引导阶段信号弱和 PRM 作为最终评判者能力不足,并发布了去噪状态语料与评测工具包。

  6. HuggingFace Daily Papers(社区热门论文)40

    TaH2:用自适应循环 Transformer 改进测试时扩展

    针对循环 Transformer 在测试时扩展上的不足,研究者提出 TaH2,通过前瞻深度监督联合后训练主干网络与迭代决策器,让额外迭代只作用于真正受益的 token。在 AIME 基准上,TaH2 将准确率-算力斜率提升 53%(2.74 对 1.79),同等测试算力下峰值准确率超出非循环基线约 3.4 分;迭代深度从 2 增至 8 时,其增益从 +2.8 分扩大到 +3.9 分。代码已开源。

9月27日周日
  1. HuggingFace Daily Papers(社区热门论文)34

    SciGen-Verifier:面向科学图像生成可解释验证的多模态推理器

    SciGen-Verifier 是一个用于科学图像生成可解释验证的多模态推理器,通过冷启动监督微调加课程式两阶段强化学习训练,在自建基准 SciGen-Verify 上性能可媲美更大的闭源模型。该基准覆盖指令遵循、多学科推理与世界知识,采用二值判断、解释与纠错编辑指令的三层协议。它还可作为在线 critic 用于图像的迭代修正。

  2. HuggingFace Daily Papers(社区热门论文)38

    EAPO:面向 LLM 推理探索的熵引导信用分配方法

    针对 RLVR 中细粒度信用分配依赖辅助模型或额外采样的问题,研究者提出熵引导信用分配方法 EAPO,将归一化策略熵与响应优势符号耦合,对成功响应中的高熵决策加强强化、对失败响应中的低熵决策加强惩罚,同时衰减不确定位置的惩罚以保留恢复机会。

9月26日周六
  1. HuggingFace Daily Papers(社区热门论文)36

    重新审视 LLM 强化学习中的训练-推理不匹配:来源与校正方法

    研究揭示 LLM 强化学习(RLVR)中训练引擎与推理引擎对同一 token 赋予不同概率的问题,并提出校准重要性采样(CIS)进行校正。CIS 基于 logit 位移刻画,采用置信度感知截断:大正位移在单一常数阈值处截断,映射为随 token 置信度升高而收紧的重要性比率上限。在三个 MoE 模型和五个数学推理基准上,CIS 均取得最高五基准平均分。

9月25日周五
  1. HuggingFace Daily Papers(社区热门论文)51

    PUBG Ally:PUBG 中可语音对话的具身智能体队友

    论文介绍 PUBG Ally,一个在 PUBG: BATTLEGROUNDS 中作为语音队友的具身智能体,可感知动态游戏环境并自主行动。语言模型智能体通过受控接口检查游戏信息、理解玩家语音并下发高层动作,交给更快的控制层执行移动、战斗和恢复;团队基于近 39k 场真实玩家共玩对局的数据做迭代训练,并通过模型压缩、上下文压缩、安全训练和运行时护栏实现低延迟端侧部署与玩家沟通安全。

  2. HuggingFace Daily Papers(社区热门论文)35

    ARGUS:基于语言模型的气候政策因果评估审计框架

    研究提出 ARGUS,一种结构化语言模型流水线,用于审计气候政策差分法(DID)研究中的识别假设证据。ARGUS 依据十一维假设-含义-证据准则进行评估,并在无法检索相关证据时选择弃权。在注入缺陷的基准测试中,ARGUS 检测到 73% 的植入缺陷,显著高于关键词基线的 18%。在经济学论文评估中,约 40% 的维度因缺乏可检索证据而弃权。该工具旨在为专家审查提供风险定位报告,而非直接裁定因果主张。代码与数据已开源。

  3. HuggingFace Daily Papers(社区热门论文)39

    提出连续深度批处理技术,实现循环语言模型的高效自适应推理

    针对循环语言模型(Looped LMs)中不同 token 循环次数不同导致无法使用标准批处理系统的问题,研究者提出了“连续深度批处理”(CDB)方法。该方法通过在循环步骤间动态构建新批次、管理 KV 缓存及预测退出时机,实现了高效的深度自适应推理。实验表明,全循环架构最适合此方法,CDB 可实现高达 99% 的预估最大加速比。

9月24日周四