跳到正文

#图像生成

今日 0 条
9月29日周二
  1. HuggingFace Daily Papers(社区热门论文)38

    MT-OPSD:面向多轮图像编辑的在线策略自蒸馏框架

    针对现有图像编辑模型在递归编辑中快速退化的问题,研究者提出 MT-OPSD 在线策略自蒸馏框架,让模型在自生成的条件下状态上训练,并由干净条件教师模型提供编辑监督,无需多轮标注。该工作同时发布 LME-Bench,包含 100 组十轮编辑会话,用于评估长程鲁棒性。在三个编辑骨干上的实验显示,MT-OPSD 显著提升长程编辑成功率、减少多轮崩溃,并基本保持单轮编辑质量。

9月27日周日
  1. HuggingFace Daily Papers(社区热门论文)41

    结构化残差连接对 Diffusion Transformer 为何重要

    研究提出将 Diffusion Transformer 的残差连接从被动求和改为主动检索机制,通过结构化连接设计让每个 Transformer block 选择性关注早期层表示。该方法训练迭代次数最多减少 1.73 倍,额外参数不到 0.1%,将 REPA-XL/2 的无引导 FID 从 5.9 降至 4.34,使用 classifier-free guidance 时达到 1.39 FID。

9月26日周六
  1. HuggingFace Daily Papers(社区热门论文)38

    神经图像水印中的残差可迁移性研究:CoverLock 防御策略

    研究提出残差可迁移性(RT)指标,量化神经图像水印证据在跨图像迁移后的可解码程度,发现架构设计而非训练侧变化是 RT 差异的主因,并识别出两种强化水印证据对载体图像依赖的机制。针对难以重新设计架构的现有水印系统,作者提出即插即用策略 CoverLock,在高 RT 水印系统上实现了优于传统手工防御和基于学习分类器防御的安全—鲁棒性权衡。

9月22日周二
  1. HuggingFace Daily Papers(社区热门论文)45

    FoMo:利用扩散模型轨迹分叉时刻自动生成感知距离标签

    该论文提出 FoMo(Forking Moment),一种全自动数据生成管线,用于在无需人工标注的情况下生成图像对之间的点式感知距离标签。方法利用扩散模型的生成动态,认为早期时间步决定粗结构,晚期决定细节;图像在生成轨迹中“分叉”越早,感知距离越远。实验表明该方法能对齐人类视觉系统,并用于训练参考型图像质量评估指标,在多个基准上超越依赖人工标注的数据集。

9月4日周五
9月2日周三
  1. HuggingFace Daily Papers(社区热门论文)34

    ReFlowSET:面向 SAR 到 EO 图像翻译的表征对齐潜空间流匹配框架

    KAIST-VICLab 提出 ReFlowSET,一种条件潜空间流匹配框架,通过 SAR-EO 联合重建审计选择潜空间编解码器,并在该空间从零训练规模更小的条件 DiT。方法将中间噪声 EO 特征与冻结视觉基础模型提取的干净目标表征对齐,仅用于训练阶段,不增加推理成本;在 QXS-SAROPT 和 SAR2Opt 上取得 SOTA,代码与权重已在 GitHub 公开。

9月1日周二
  1. HuggingFace Daily Papers(社区热门论文)36

    BLARM:通过混合潜在刚性运动基元从视频驱动 3D 物体动画

    论文提出 BLARM,一种前馈方法,输入单目视频和静态物体网格,即可预测运动跟随视频的时序连贯动画网格。方法用少量随时间变化的刚性运动分量和顶点到分量的蒙皮权重表示动画,无需骨骼、cage、蒙皮权重或绑定标注,通过分解时空注意力将几何形变潜变量条件于视频特征,并以轨迹重建、熵正则和运动感知对比学习训练,生成准确且时序稳定的动画。

1月10日周六
  1. Berkeley AI Research22

    信息驱动的成像系统设计:Berkeley 提出基于互信息的成像评估框架

    Berkeley AI Research 提出一种直接评估和优化成像系统信息量的框架,通过互信息量化测量对物体的区分能力,统一了分辨率、噪声、采样等传统指标。该方法仅从测量数据和已知噪声模型估计信息量,在彩色摄影、射电天文、无透镜成像和显微镜四个领域验证,信息估计能预测解码器性能,优化后的设计达到端到端方法水平,且内存和计算需求更低、无需任务专用解码器。