跳到正文

#论文/研究

今日 0 条
9月3日周四
  1. HuggingFace Daily Papers(社区热门论文)44

    研究提出 Switch Distillation:中训练阶段知识蒸馏更利于推理而非事实记忆

    研究发现前向 KL 蒸馏在 pre-training 阶段同时提升推理与事实记忆,但在 mid-training 阶段会拖慢事实记忆习得,同时推理仍持续提升。作者提出 Switch Distillation,以教师预测熵作为路由信号,仅在教师置信的 token 上蒸馏,其余回退到交叉熵。

  2. HuggingFace Daily Papers(社区热门论文)44

    模仿学习能否保持灵巧操作的时间鲁棒性?专家与学习者在不同任务执行速度下的对比

    论文在 ParcelStow 接触密集任务中对比脚本专家与基于 ACT 训练的模仿策略在不同加速倍数下的表现,发现两者在名义速度下均为 100% 成功,但在最大演示速度下专家成功率为 84%,ACT 仅 53%,且两种不同参数初始化的 ACT 策略分别下降 34 和 48 个百分点,专家仅下降 16 个百分点。

  3. HuggingFace Daily Papers(社区热门论文)40

    DramaChain Bench 发布:覆盖短剧生成全流程的端到端基准

    DramaChain Bench 是首个评估短剧生产完整链路(剧本、分镜、关键帧、镜头视频到成片)各阶段的基准,包含五条评估轴、63 个叶子维度。基准由 5785 个条目经三名专业标注者独立打分,产生 17,488 个有效评分和 255,925 条可追溯归因记录;人工标注证实上游缺陷会跨阶段级联,最终成片质量并非只由视频生成决定。

  4. ARC Prize:官方博客79

    ARC Prize 发布 OpenAI GPT-6 Astra 在 ARC-AGI-3 上的评测结果

    ARC Prize 报告 OpenAI 的 GPT-6 Astra 在 ARC-AGI-3 Semi-Private 上,Standard harness 得分 62.7%(成本 $26K),Provider Adapter harness 得分 99.9%(成本 $19K),均为 SOTA。

    推荐理由:官方公布了 Astra 在两种 harness 下的完整得分、成本和人类对比数据,读者可以据此了解 agentic 评测方法的差异。

9月2日周三
  1. IT之家(RSS)46

    新加坡科技设计大学研究发现老年群体更看重 AI 陪伴聊天机器人的真实感而非拟人化

    新加坡科技设计大学研究人员让 140 名 60 至 89 岁老年人与其社交聊天机器人 Ami Chat 互动,研究发表于《老龄化创新》期刊。结果显示,社会关系相关三个指标(拟人化、真实性、AI 社交互动强度)在使用意愿差异中额外解释了 27%;感觉更真实、互动更具回应性时使用意愿更高,但认为机器人更像真人的参与者意愿反而更低;自评健康状况较差者使用意愿更强。

  2. Hacker News 热门(buzzing.cc 中文翻译)54

    论文提出人工神经网络内部涌现出符号结构

    论文提出神经网络向量表示隐式实现了 Tensor Product Representation 符号结构,作者用 DISCOVER 方法将多种网络(含 Gemma-3-27b、GPT-2-XL、GPT-OSS-20b、Pythia-12b、Qwen3-14b、OLMo-2-13B、Llama-3.1-8b 共 7 个 LLM)的表示替换为符号化闭式方程,模型行为基本不变。

  3. HuggingFace Daily Papers(社区热门论文)59

    Harness-of-Harness 论文提出多天自主软件开发框架,平均相对提升 52.25%

    论文提出 Harness-of-Harness(HoH)框架,让基于 LLM 的编码智能体在无人工干预的自主开发中持续改进软件。HoH 运行在现有 coding-agent harness 之上,将执行组织为规划-编码-测试的迭代循环,平衡修复与能力增长,并把开发拆成小而可验证的增量。

  4. HuggingFace Daily Papers(社区热门论文)34

    ReFlowSET:面向 SAR 到 EO 图像翻译的表征对齐潜空间流匹配框架

    KAIST-VICLab 提出 ReFlowSET,一种条件潜空间流匹配框架,通过 SAR-EO 联合重建审计选择潜空间编解码器,并在该空间从零训练规模更小的条件 DiT。方法将中间噪声 EO 特征与冻结视觉基础模型提取的干净目标表征对齐,仅用于训练阶段,不增加推理成本;在 QXS-SAROPT 和 SAR2Opt 上取得 SOTA,代码与权重已在 GitHub 公开。

  5. HuggingFace Daily Papers(社区热门论文)44

    研究揭示原生统一多模态模型中理解与生成的协同机制

    该论文在无预训练视觉先验的受控原生设置下,从表征、任务和系统三层研究统一多模态模型中视觉理解与生成的关系。研究发现两个目标可互相提供有用信号但共享计算路径时一方会主导,任务解耦架构可避免这种不对称退化;共享知识任务间存在正向双向迁移,端到端 UMM 在同时需要图像理解与生成的复杂任务上优于匹配的规划器-执行器流水线。

  6. HuggingFace Daily Papers(社区热门论文)37

    多智能体 LLM 提示词优化新方法:控制-数据流分离

    论文提出控制-数据流分离方法,将消息路由、输出格式、终止信号等执行关键协议表示为类型化、经验证的程序对象,任务相关语言作为可优化的数据流,避免提示词优化破坏协议导致智能体流水线失败。在合成推理、协作评审生成和保险评级工作流中,框架实现 100% 的最终协议有效性,同时持续提升任务性能。

  7. HuggingFace Daily Papers(社区热门论文)45

    DroneCATS:评测多模态大模型作为无人机通用视觉-语言-动作智能体

    论文提出 DroneCATS-Agent 架构和 DroneCATS 基准,将多模态大模型直接放入无人机控制回路,无需微调或函数调用,评测接近、跟踪、视外搜索和多机指挥四项能力。结果显示小型开源模型导航成功率常高于前沿模型,却因过早或从不宣布到达而失败;模型的视觉空间感知尚可,瓶颈在于维持动作协议并正确发出终止动作。

  8. HuggingFace Daily Papers(社区热门论文)47

    StudentSim:训练基于 LLM 的学生模拟器框架

    论文提出 StudentSim,通过池化训练加按学生专门化,把稀疏的学生个人数据转化为能模拟学生应答并在辅导下更新的个性化学生模拟器。配套发布 StudentSimEval 评测协议,覆盖国际象棋、英语二语写作和数学 3 个领域的 60 名学生,衡量行为保真度 F 和指导响应度 R。

  9. HuggingFace Daily Papers(社区热门论文)54

    论文提出评估框架:防护手段本地测试通过不等于部署后的 LLM 系统更安全

    Hefei AiDA Lab 等机构的研究者提出一套将 LLM 防护评测结果转换为部署安全结论的分析框架,并对其编码的 198 篇论文进行分析。152 个宽编码声明中有 108 个建立了正向残余有害协助,没有一个建立零残余证书;24 个深度编码实例中仅 5 个报告了检查成功后的可达残余,仅 Fides 一个实例通过覆盖、条件失败与后续可达三项证明给出零残余证书。

  10. HuggingFace Daily Papers(社区热门论文)38

    RoboTok:面向人类示范检索与灵巧操作学习的互联网规模数据引擎

    论文提出 RoboTok,一个互联网规模数据引擎,输入人类操作视频即可从网络视频中检索与操作相关的人类示范,用于训练灵巧机器人策略。方法基于估计的演员中心参考系中的 3D 手部轨迹学习潜在运动空间,使操作行为的比较不受相机视角、场景外观和演员遮挡影响,并支持互联网规模视频的高效搜索与持续索引。在检索基准和下游策略评估中,RoboTok 检索出更相关的示范并提升了下游任务成功率。