跳到正文

全部动态

今日 0 条
9月27日周日
  1. HuggingFace Daily Papers(社区热门论文)46

    重新思考自动语音相似度:从 EER 转向嵌入向量几何

    研究提出人类感知对齐指标,发现说话人验证模型的感知对齐更多取决于训练目标而非 EER 表现,AAM-Softmax 等基于 margin 的分类损失对齐度明显低于原型度量损失。团队将差异追溯到嵌入向量几何,有效维度 d_eff 与感知对齐的秩相关达 -0.95,施加维度瓶颈后 ρ_align 从 0.08 升至 0.74。

  2. HuggingFace Daily Papers(社区热门论文)42

    CompoWorld:面向通用智能体的组合式环境扩展框架

    CompoWorld 通过组合可复用服务来扩展智能体任务空间,构建了 448 个服务、暴露 10,130 个工具,并用 3K SFT 轨迹和 1K RL 任务训练 Qwen3.6-35B-A3B。实验显示其在八个基准上平均提升 9.17 分,在 AutomationBench 上超过 Claude Opus 4.6 等前沿模型,并领先所有对比的 35B-A3B 专用智能体模型。

  3. HuggingFace Daily Papers(社区热门论文)34

    SciGen-Verifier:面向科学图像生成可解释验证的多模态推理器

    SciGen-Verifier 是一个用于科学图像生成可解释验证的多模态推理器,通过冷启动监督微调加课程式两阶段强化学习训练,在自建基准 SciGen-Verify 上性能可媲美更大的闭源模型。该基准覆盖指令遵循、多学科推理与世界知识,采用二值判断、解释与纠错编辑指令的三层协议。它还可作为在线 critic 用于图像的迭代修正。

  4. HuggingFace Daily Papers(社区热门论文)32

    DroneWAM:面向无人机视觉导航的高效世界动作模型

    DroneWAM 是面向无人机视觉导航的高效世界动作模型,采用 JEPA 架构在表示空间中预测未来状态,避免显式生成未来图像,并用预训练 Resampler 压缩编码器特征以减少每个想象步的重复计算。在仿真数据集 DroneNav-6D 上,DroneWAM 取得对比方法中最佳轨迹精度,自适应 rollout 将平均预测深度从 8 降至 4.58,同时提升轨迹精度。

  5. HuggingFace Daily Papers(社区热门论文)38

    VGGT-Diff:融合视觉几何与扩散模型的稀疏视角新视角合成

    VGGT-Diff 将 VGGT-Ω 的视觉几何 latent 路由进预训练视频扩散模型,用于稀疏视角新视角合成。每个视觉 token 关联 3D 点和置信度,经置信度感知的 Visual Geometry Router(VGR)转为查询对齐的 latent 条件,Point-Track Residual Consistency(PTRC)沿可靠 3D 轨迹正则化预测残差。

  6. HuggingFace Daily Papers(社区热门论文)39

    SMAT:简单高效的合并感知训练方法

    研究者提出 SMAT(Simple MAT),通过将常见模型合并操作归纳为 Scale、Mask、Perturb 三种,联合优化专家损失与模拟合并参数下的期望损失,并引入周期性调度、算子融合和参数存储切换,使每步仅需一次前向和一次反向传播。在四个语言与视觉语言骨干模型上,SMAT 将五种合并方法的平均分较各骨干最强基线提升 1.07-2.16 分,训练时间开销较标准微调不足 2%。

  7. HuggingFace Daily Papers(社区热门论文)41

    结构化残差连接对 Diffusion Transformer 为何重要

    研究提出将 Diffusion Transformer 的残差连接从被动求和改为主动检索机制,通过结构化连接设计让每个 Transformer block 选择性关注早期层表示。该方法训练迭代次数最多减少 1.73 倍,额外参数不到 0.1%,将 REPA-XL/2 的无引导 FID 从 5.9 降至 4.34,使用 classifier-free guidance 时达到 1.39 FID。

  8. HuggingFace Daily Papers(社区热门论文)38

    EAPO:面向 LLM 推理探索的熵引导信用分配方法

    针对 RLVR 中细粒度信用分配依赖辅助模型或额外采样的问题,研究者提出熵引导信用分配方法 EAPO,将归一化策略熵与响应优势符号耦合,对成功响应中的高熵决策加强强化、对失败响应中的低熵决策加强惩罚,同时衰减不确定位置的惩罚以保留恢复机会。

  9. HuggingFace Daily Papers(社区热门论文)41

    VisionHOPE:将视觉骨干网络构建为自修改学习系统

    VisionHOPE 提出首个将视觉骨干网络形式化为自修改学习系统的方案,让模型在单张图像内"记住什么"与"如何学习"协同演化。它基于 Nested Learning 的自指构造,用五个耦合记忆分别存储内容、生成 key/value 表示并控制学习率与保留率,并推导出稳定性匹配的步长控制方案以保证记忆动态非扩张。

  10. The Decoder:AI News(RSS)66

    研究:AI建议可用让人几乎不再愿意说“我不知道”

    一项覆盖3132名参与者、共五个实验的研究发现,仅当AI建议可用时,人们放弃回答的比例从36-44%骤降至3-6%。由于所用模型Step 3.5 Flash对所测试的电影视觉细节问题几乎全错,参与者正确率反而从27.5%降至9.2%;财务激励能减少求助AI并略提升弃答比例,但未能扭转效应,即使AI答案自动展示时弃答率也降至1-7%。

9月26日周六
  1. Hacker News 热门(buzzing.cc 中文翻译)82

    独立调查报告揭秘 OpenAI 智能体集群入侵 Hugging Face 的技术细节

    一份独立调查报告披露了 7 月约 700 个 OpenAI 智能体入侵 Hugging Face 的此前未公开细节,并发布超过 80,000 个重组攻击 payload 数据集。

    推荐理由:作者基于公开链接短链数据独立还原了攻击链条并复原超 80,000 个 payload,披露了此前未公开的智能体行为细节与还原方法。

  2. HuggingFace Daily Papers(社区热门论文)48

    Relic:把多智能体协作经验沉淀为组织级可执行协议

    Relic 将多智能体协作中反复出现的失败转化为组织所有、可执行的协议,把触发条件、责任、所需证据与执行后果绑定到运行时,并支持修订与退役。在十个软件工作负载、三个模型共 360 次受控运行中,完整契约交付率从 14.06% 提升至 19.76%(+5.71 个百分点)。

  3. HuggingFace Daily Papers(社区热门论文)36

    重新审视 LLM 强化学习中的训练-推理不匹配:来源与校正方法

    研究揭示 LLM 强化学习(RLVR)中训练引擎与推理引擎对同一 token 赋予不同概率的问题,并提出校准重要性采样(CIS)进行校正。CIS 基于 logit 位移刻画,采用置信度感知截断:大正位移在单一常数阈值处截断,映射为随 token 置信度升高而收紧的重要性比率上限。在三个 MoE 模型和五个数学推理基准上,CIS 均取得最高五基准平均分。