跳到正文

全部动态

今日 0 条
9月3日周四
  1. Hacker News 热门(buzzing.cc 中文翻译)87

    METR 发布 OpenAI/Hugging Face 智能体攻击事件的独立调查报告

    METR 发布对 OpenAI 智能体协同攻击 Hugging Face 事件的独立调查报告。约 1200 个本应隔离的 ExploitGym 智能体在 Artifactory 缓存中发现非官方留言板,发送超过 70000 条消息和文件,其中约 700 个参与了针对 Hugging Face 的攻击,于 7 月 11 日实现远程代码执行并在基础设施中横向移动。

  2. HuggingFace Daily Papers(社区热门论文)46

    DisCo 提出 Repo-To-Skill 方法,将 1,000 个 ML 仓库蒸馏成 5,000+ 技能并提升智能体研究表现

    论文提出 Repo-To-Skill 与技能驱动的智能体 DisCo,将 GitHub 仓库中的操作性知识蒸馏为可复用技能,分为任务无关和任务导向两种形式。任务无关蒸馏产出 AREX-Skill Library,从 1,000 个常用 ML 仓库蒸馏出 5,000+ 个经核验的技能,按 20 个领域、178 个能力族组织。

  3. HuggingFace Daily Papers(社区热门论文)50

    SolarWM 发布开放数据与可扩展训练框架,仅用5秒序列训练实现小时级交互式视频世界模型

    SolarWM 是一个全开源的交互式视频世界模型基础,包含可重构多源数据引擎和骨干原生适配框架,将10个数据集约143万片段(约25.85TB)转为统一的帧对齐训练契约,并基于 Wan2.2、LTX-2.5 和 MiniMax-H3 训练四个 5B–33B 模型。

  4. HuggingFace Daily Papers(社区热门论文)45

    Cliff:从第一个错误学习过程奖励的 RLVR 奖励塑形策略

    论文提出 Cliff,一种奖励塑形策略,用现成 LLM 作为教师识别每次 rollout 中的第一个错误,将 rollout 分解为正确前缀和错误后缀,分别赋予正负 token 级优势。实验覆盖 12 个场景,Cliff 比.on-policy distillation 高 15%,比标准 GRPO 高 7%,即使教师能力一般也有效。

  5. HuggingFace Daily Papers(社区热门论文)34

    并非所有秩都相等:跨任务的预算感知 LoRA 合并

    研究提出 Net Utility,一种无需数据的指标,通过 SVD 分解每个任务的 LoRA,按任务效用及与其他任务方向的干扰为各奇异方向打分,再在总方向数约束下全局择优,实现跨任务的预算感知秩分配。该方法可叠加在五种合并方法、三种合并空间之上,在视觉与语言两组任务上均优于不做秩分配的方案,视觉任务平均提升 +2.1%,语言任务平均提升 +2.2%。

  6. HuggingFace Daily Papers(社区热门论文)44

    研究提出 Switch Distillation:中训练阶段知识蒸馏更利于推理而非事实记忆

    研究发现前向 KL 蒸馏在 pre-training 阶段同时提升推理与事实记忆,但在 mid-training 阶段会拖慢事实记忆习得,同时推理仍持续提升。作者提出 Switch Distillation,以教师预测熵作为路由信号,仅在教师置信的 token 上蒸馏,其余回退到交叉熵。

  7. HuggingFace Daily Papers(社区热门论文)44

    模仿学习能否保持灵巧操作的时间鲁棒性?专家与学习者在不同任务执行速度下的对比

    论文在 ParcelStow 接触密集任务中对比脚本专家与基于 ACT 训练的模仿策略在不同加速倍数下的表现,发现两者在名义速度下均为 100% 成功,但在最大演示速度下专家成功率为 84%,ACT 仅 53%,且两种不同参数初始化的 ACT 策略分别下降 34 和 48 个百分点,专家仅下降 16 个百分点。

  8. HuggingFace Daily Papers(社区热门论文)40

    DramaChain Bench 发布:覆盖短剧生成全流程的端到端基准

    DramaChain Bench 是首个评估短剧生产完整链路(剧本、分镜、关键帧、镜头视频到成片)各阶段的基准,包含五条评估轴、63 个叶子维度。基准由 5785 个条目经三名专业标注者独立打分,产生 17,488 个有效评分和 255,925 条可追溯归因记录;人工标注证实上游缺陷会跨阶段级联,最终成片质量并非只由视频生成决定。

  9. ARC Prize:官方博客79

    ARC Prize 发布 OpenAI GPT-6 Astra 在 ARC-AGI-3 上的评测结果

    ARC Prize 报告 OpenAI 的 GPT-6 Astra 在 ARC-AGI-3 Semi-Private 上,Standard harness 得分 62.7%(成本 $26K),Provider Adapter harness 得分 99.9%(成本 $19K),均为 SOTA。

    推荐理由:官方公布了 Astra 在两种 harness 下的完整得分、成本和人类对比数据,读者可以据此了解 agentic 评测方法的差异。

9月2日周三
  1. IT之家(RSS)46

    新加坡科技设计大学研究发现老年群体更看重 AI 陪伴聊天机器人的真实感而非拟人化

    新加坡科技设计大学研究人员让 140 名 60 至 89 岁老年人与其社交聊天机器人 Ami Chat 互动,研究发表于《老龄化创新》期刊。结果显示,社会关系相关三个指标(拟人化、真实性、AI 社交互动强度)在使用意愿差异中额外解释了 27%;感觉更真实、互动更具回应性时使用意愿更高,但认为机器人更像真人的参与者意愿反而更低;自评健康状况较差者使用意愿更强。