从强化学习视角看 OPD:面向样本高效 LLM 推理的最小二乘策略蒸馏
研究者从强化学习视角重新审视 on-policy distillation(OPD),提出 Least-Square Policy Distillation(LSPD)框架,将价值型 RL 中的乐观探索与 off-policy 数据复用引入策略蒸馏。
研究者从强化学习视角重新审视 on-policy distillation(OPD),提出 Least-Square Policy Distillation(LSPD)框架,将价值型 RL 中的乐观探索与 off-policy 数据复用引入策略蒸馏。
EvolvingAvatar 是一种因果生成器,通过测试时训练在交互过程中适配用户面部视频与双人音频,其双人上下文预测目标无需测试时目标动作标注即可提供自监督信号。
研究以 1,813 组匹配的美式英语(AmE)与英式英语(BrE)变体为资源,提出免训练的 DiAlign 方法,从数据分布证据估计区域对齐度。AmE 在全部 6 个预训练语料和 21 个后训练数据集中均被偏好,tokenizer 表示更紧凑、预测成本更低,且在中性英语提示下仍是默认生成偏好;改用英式英语提示可向 BrE 偏移,但无法稳定消除 AmE 默认。
TokenCast 通过学习每个执行片段的可组合成本表示,在 LLM 智能体运行过程中实时预测 token 消耗,无需额外调用 LLM,在 SWE-bench Verified 上平均累计预测耗时 32.8 ms。
该专著提出 PLDR-LLM(幂律解码器表示语言模型)训练与推理的统一理论框架,用有限工作恒等式将行中心学习映射的绝对能量变化分解为参数贡献、带符号交互与数值观测缺陷。实验揭示了观测器与优化器依赖性,否定了所测试的自主行状态候选方案,并支持有限条件预测与状态特定的算子约简。理论区分了精确恒等式、条件动力学主张与有限实证发现,并给出证明、形式化检验与紧凑数值证据。
研究显示,在同等前向计算预算下,确定性 PRM 引导的离散扩散语言模型推理不如独立采样加 ORM 重排。在 Dream-v0-Instruct-7B 上,GSM8K 每题 8 个候选时前者准确率 65.18%,后者达 75.13%,32 个候选时差距扩大到 12.69 个百分点。作者将其归因于引导阶段信号弱和 PRM 作为最终评判者能力不足,并发布了去噪状态语料与评测工具包。
WorldPlay2 是一个交互式世界模型,通过分解式混合控制接口与压缩记忆、稳定蒸馏的协同设计,兼顾长时一致性与实时响应。该接口将帧对齐动作控制与结构化语义控制结合,显式解耦场景外观、角色身份和动态语义事件;同时将历史上下文压缩为记忆 token,供自回归学生模型与双向教师模型共享,实现按片段进行记忆条件打分,大幅降低蒸馏开销。
苏黎世联邦理工学院软体机器人实验室基于常规仿人机械手,用强化学习训练出可依靠指尖自行行走的机械手,整机重 818 克,搭载树莓派机载计算机可独立运行。该机械手在 NVIDIA Isaac Lab 仿真平台完成训练,已在沥青、草地、碎石等 14 种表面爬行,25 次被碰倒中 21 次能自主站起;手指仍可恢复普通操作,敲键盘正确率达 90%,并通关推箱子游戏、定位精度达毫米级。
针对循环 Transformer 在测试时扩展上的不足,研究者提出 TaH2,通过前瞻深度监督联合后训练主干网络与迭代决策器,让额外迭代只作用于真正受益的 token。在 AIME 基准上,TaH2 将准确率-算力斜率提升 53%(2.74 对 1.79),同等测试算力下峰值准确率超出非循环基线约 3.4 分;迭代深度从 2 增至 8 时,其增益从 +2.8 分扩大到 +3.9 分。代码已开源。
研究团队提出 AdaGuard 系列 Guard 模型(0.6B、4B、8B),可在推理时按用户自定义策略评估语言模型智能体的轨迹。
EditWorld 是一个支持精准编辑与灵活引用的视频世界模型,可在自回归生成过程中流式接收编辑指令和参考图像,将世界建模从探索扩展到精准修改。它引入 Gated Causal Attention 处理时变编辑条件与参考图像,并用 Sparse Context 机制维持有界历史上下文以支持长时程推理。
BaRe-Mem 是一种面向多智能体咨询的在线贝叶斯可靠性记忆,基于中心模型的内部信念表示估计顾问可靠性,并用历史交互更新这些估计,从而调节顾问回答的影响、决定是咨询还是自主推理。
研究者推出 SolveEdit 基准,用于评估生成模型通过场景变换完成视觉问题求解的能力,包含 2,728 个案例,并用原子变换契约与 SolveScore 在无需参考输出的情况下衡量完成度与误改。
PReCache 是一个免训练的 KV cache 共享框架,通过 PreLRShared 和 ReBaseShared 两种设计共享基于预训练权重计算的基础 cache,并预计算紧凑的智能体专属低秩(LR)cache。
KVCMAS 是一个面向多智能体系统的在线 KV cache 修正框架,用紧凑低秩状态表示跨智能体的缓存偏差,并沿智能体工作流链式修正,无需额外参考预填充。
论文提出 FlyBy,一个选择性查询框架,训练 4B 和 8B 小型推理模型先推理、诊断未解决问题,在知识瓶颈时查询参数知识更强的模型。研究发现自精炼主要把概率质量集中在当前状态已可达的解上,并区分出执行瓶颈与知识瓶颈两类失败机制。
MIT 研究者 Brian Hedden 与 Manish Raghavan 系统评估了针对算法单一栽培的主要反对意见,发表于 Philosophical Perspectives。
研究者提出 Physical Coding,将任务状态与执行表示为代码,并构建 HexaAnything 调用感知、规划与控制工具(含 VLA/WAM 策略),依据外部反馈在环决策。
PyroAdapt 用"预训练—检索—排序"框架让山火预测模型适应目标分布:在加州 666 个 0.25x0.25 网格上,选择性排序将日均精度从 21.62% 提升至 24.35–24.57%,Top5% 召回率从 18.70% 升至 22.11–22.79%。
ControlScope 对比了 LLM 智能体在同一公开执行状态下继续生成代码、编辑下一次工具调用的数据参数、以及替换未完成工作流三种修订方式,并区分可用修复与智能体实际选择的动作。
研究提出 δ-Vision,用轻量低秩适配器构建逐层视觉记忆,替代视觉 token 在 Transformer 中的重复演化,同时保留全部视觉 token 供文本检索。该方法发现视觉到文本的信息流集中在低维子空间,且轻量 MLP 能以高余弦相似度和低重建误差逼近各层视觉状态。在图像和视频基准上,δ-Vision 在相当或更低计算量下准确率超过视觉 token 剪枝基线,且不丢弃视觉 token。
作者用 GLiNER 对六个刀具 subreddit 共 51,129 条评论做品牌标注,并用 1,000 次随机重排估计基线,发现头部 5%(49 个)账号在求购帖中写出 11.3% 的品牌提及,高于 7.9% 的随机预期。
据彭博社报道,20 多名 AI 行业领袖在一篇新论文中警告,用 AI 自动化下一代模型研发可能导致技术进步突然加速的智能爆炸,其速度或超过社会适应能力。联署者包括 Anthropic 联合创始人杰克·克拉克、OpenAI 首席科学家雅库布·帕乔茨基、杰弗里·辛顿、约书亚·本吉奥等。
20 多位 AI 研究者在论文中警告,自我改进的 AI 可能引发智能爆炸,签署者包括 Geoffrey Hinton、Yoshua Bengio 和 OpenAI 研究负责人 Jakub Pachocki。
FuseReg 正则化层融合缓解表征自编码器中的重建-生成差距 论文:https://huggingface.co/papers/2609.31620
Apple 研究者针对联邦随机变分不等式(VI)提出改进收敛速率:先证明经典 Local Extra SGD 在光滑单调 VI 下经更精细分析可得更紧的保证,随后指出其客户端漂移过大的固有缺陷。
MIT研究人员借助AI算法优化脂质纳米颗粒(LNP)的辅料配比,成功开发出耐热性更强的RNA疫苗配方。该配方使疫苗在室温下可稳定保存一年,或在37摄氏度下保存两个月,且在小鼠实验中产生的免疫反应与Moderna类似。AI算法通过少量实验数据快速收敛至最优解,将原本需数月的筛选过程缩短至几周。相关成果发表于《Nature Biotechnology》。
推荐理由:展示了AI在小数据集和复杂生物化学问题中的高效应用,显著加速了药物研发流程,具有明确的科学突破和实际应用价值。
一篇 arXiv 论文提出多智能体 AI 架构,借鉴 D. Kahneman 的"快思考与慢思考"理论,让系统 1(快速)智能体仅凭过往经验响应问题,系统 2(慢速)智能体则在需要推理和搜索最优解时被刻意激活。两类智能体均由世界模型(含环境领域知识)和"自我"模型(含系统过往动作与求解器技能信息)支撑。论文认为,研究人类具备这些能力的机制有助于理解如何让 AI 系统获得同类能力。
Google Research 推出 AI 视频联合导演,由 4 个智能体框架组成,运行在 Gemini 和 Veo 之上,用于解决多镜头 AI 视频中的身份漂移和级联错误问题。
SkillGym 框架将人类编写的技能转化为 2,756 个带代码检查器的训练环境,并在 8,364 条成功轨迹上微调。
小米官方复盘 MiMo-V2.6 发布后的工具调用重复问题,响应级重复率超 0.05%,并区分了正常并行调用、调用泛滥与调用重复。回放 RL 各 checkpoint 显示泛滥率随训练从 11.1% 升至 24.6%,32 次调用阈值惩罚过于宽松;直接调低阈值需重启 20 步 MixRL,估计成本 231 万美元,且内部测试重复率仅从 13.45% 降至 3.83%。
推荐理由:原文给出完整的归因实验和修复路径,还公开了成本对比,读者可借鉴其诊断 RL 训练中涌现行为的方法。
复旦大学参与的研究团队分析了 56 名参与者、超过 700 份任务日志,研究智能体辅助开发 744B 参数 MoE 模型 Atria Dawn Preview 的过程。四周内每个人类输入对应的智能体操作中位数从 11 升至 28.5,约三分之一的 AI 辅助任务没有 AI 就不会启动,但方法和参数的最终决策 85.5% 由人类做出。团队提醒,长链智能体工作可能让人类监督退化为走过场式审批。
一项 arXiv 研究(https://arxiv.org/abs/2609.25021)发现 chat template 像开关一样控制 LLM 的自指语气:8 个 9B 以下开源 instruct 模型加模板时免责声明语气(如"I'm just an AI")达 53%、体验性语气("I feel")仅 1%,去掉模板后变为 36% 和 15%。
针对长程智能体在线策略自蒸馏中的"决策—时间戳错配"问题,研究者提出 AlignOPSD,通过决策对齐监督校正与半马尔可夫分层信用分配,将监督对齐后再分配信用。
一项研究系统消融了 EEG 基础模型的时空掩码策略,在 MAE 和 JEPA 两种自监督框架下预训练 58 个模型,并在 OpenEEGBench 的 12 个数据集上用线性探针评测。