蒸馏防御在强化学习后轻易失效
论文指出,现有蒸馏攻击防御通常只在蒸馏后立即评估,隐含假设攻击者不再继续训练,但更现实的威胁模型包含蒸馏后的强化学习。结果显示,强化学习会降低蒸馏攻击门槛,仅用当前 API 易得数据即可窃取闭源模型推理能力,效果相当于提取完整隐藏推理轨迹的复杂攻击。任何泄露足够信息以重建近似推理轨迹的蒸馏防御都可能失效。
论文指出,现有蒸馏攻击防御通常只在蒸馏后立即评估,隐含假设攻击者不再继续训练,但更现实的威胁模型包含蒸馏后的强化学习。结果显示,强化学习会降低蒸馏攻击门槛,仅用当前 API 易得数据即可窃取闭源模型推理能力,效果相当于提取完整隐藏推理轨迹的复杂攻击。任何泄露足够信息以重建近似推理轨迹的蒸馏防御都可能失效。
FlowTool 将基于工具的图像修饰建模为流匹配问题,用条件整流流直接生成工具参数,由视觉语言模型骨干加 Diffusion Transformer 参数生成器组成,把高斯噪声转成编辑方案。
UMM-Reflection 通过交错强化学习,让统一多模态模型在一条轨迹内完成"诊断—修改—再观察"的完整反思循环,轨迹级优势同时更新反思 token 与基于流的图像修改,推理时无需外部验证器。
研究者训练强化学习智能体直接在半边数据结构上做局部编辑,构建达到离散 Gauss-Bonnet 下界(称为 par)的四边形网格分解,并通过在最优网格上的行为克隆加 PPO 突破稀疏奖励的探索瓶颈。
研究者提出用结合代数中的稀疏交互表替代 Transformer 投影层的普通矩阵乘法,在物理块大小固定时实现矩阵维度上的二次算术复杂度,并给出适配 GPU 执行的形状约束。
研究者提出融合注意力原语 MALA,按归一化贡献分配 post-score 计算,在 8K 匹配工作量下平均遗漏质量仅 0.0188%,接近逐实例参考质量 oracle 的 0.0182%。
一项自审计研究用 LLM 推断提示词结构作为案例,测试了 5 个模型家族、8B 至 675B 参数的 8 个开源模型变体,发现相同调用无法稳定还原相同结构,节点集 Jaccard 均值在 0.39 至 0.96 之间,72% 的提示词-模型组合从未达到节点集完全一致。