跳到正文

全部动态

今日 0 条
9月26日周六
  1. HuggingFace Daily Papers(社区热门论文)45

    SkillDRE:通过执行前与运行时反馈对 Agent 技能进行双阶段红队演化

    SkillDRE 是一个全自动框架,通过执行前扫描与运行时防御反馈的双阶段闭环,演化完整的恶意 Agent 技能包。在 SkillsBench 上对四个受害模型评测,平均攻击成功率达 45.28%,超过最强基线 40.3%,且最终提交的技能未触发任何 SkillScan 告警,并基本保留良性任务性能。结果表明,两阶段防御反馈可作为自适应红队的有效学习信号,单独评估任一防御阶段都会遗漏攻击能力。

  2. HuggingFace Daily Papers(社区热门论文)38

    神经图像水印中的残差可迁移性研究:CoverLock 防御策略

    研究提出残差可迁移性(RT)指标,量化神经图像水印证据在跨图像迁移后的可解码程度,发现架构设计而非训练侧变化是 RT 差异的主因,并识别出两种强化水印证据对载体图像依赖的机制。针对难以重新设计架构的现有水印系统,作者提出即插即用策略 CoverLock,在高 RT 水印系统上实现了优于传统手工防御和基于学习分类器防御的安全—鲁棒性权衡。

  3. Stanford HAI News(网页)58

    Stanford 研究发现 AI 基准测试常常测不出它声称测量的东西

    Stanford 研究者将在 10 月旧金山 COLM 会议上发表两项研究,用测量科学与心理测量学检验 56 个常用基准,发现基准并不总是测量其声称的能力,声称测同一属性的基准之间也常互相矛盾。研究以 BBQ 偏见基准为例指出其更像在测阅读理解,另一项研究拆解了安全分数在非英语语言中下降的原因,区分模型 guardrails 变弱与翻译后测试本身失真这两种因素。

9月25日周五
  1. HuggingFace Daily Papers(社区热门论文)51

    PUBG Ally:PUBG 中可语音对话的具身智能体队友

    论文介绍 PUBG Ally,一个在 PUBG: BATTLEGROUNDS 中作为语音队友的具身智能体,可感知动态游戏环境并自主行动。语言模型智能体通过受控接口检查游戏信息、理解玩家语音并下发高层动作,交给更快的控制层执行移动、战斗和恢复;团队基于近 39k 场真实玩家共玩对局的数据做迭代训练,并通过模型压缩、上下文压缩、安全训练和运行时护栏实现低延迟端侧部署与玩家沟通安全。

  2. HuggingFace Daily Papers(社区热门论文)45

    利用预训练扩散模型和多模态条件增强摄影测量数字表面模型

    该研究提出一种改进的 Stable Diffusion 3 架构,通过同时以摄影测量 DSM 和 Pléiades 卫星图像作为条件,对垂直配准的数字表面模型进行细化。实验表明,这种多模态条件方法能显著提升高程精度,在法国城市测试中,密集城区的 RMSE 从 6.00 米降至 3.45 米(上下文城市)及 2.76 米(留出城市)。

  3. HuggingFace Daily Papers(社区热门论文)55

    TRACE:流式视频理解的时序审计与条件感知评估框架

    论文提出 TRACE 基准,旨在解决现有流式视频理解评估中忽略证据时效性、历史维护及响应触发机制的问题。该框架通过统一因果协议控制信息可用性,并多维报告答案质量、及时性、负载等指标。在 1240 条记录上的实验显示,相似的 QA 准确率可能掩盖系统在完成度、生成负载及主动响应行为(如误报、漏报)上的巨大差异,强调应将性能视为执行条件下的系统行为而非单一分数。

  4. HuggingFace Daily Papers(社区热门论文)45

    ZooWork-ShopRanker:面向电商场景的偏好对齐重排序模型发布

    ZooWork团队发布ShopRanker系列电商重排序模型(0.6B/4B/8B),通过多LLM裁判生成偏好标签进行训练,并推出包含约1万条真实流量数据的ShopRank-Bench基准。实验显示该系列模型在电商检索任务上显著优于现有开源基线及未对齐版本,且小参数模型表现突出。目前模型与基准已开源。

  5. HuggingFace Daily Papers(社区热门论文)38

    MOPD-Router:多教师在线蒸馏中的令牌级路由新框架

    针对多教师在线蒸馏(MOPD)中依赖提示词级领域标签进行硬路由的局限,研究者提出 MOPD-Router 框架。该框架无需领域标签或独立路由模型,即可在每个令牌级别对全教师池的监督信号进行路由。其中提出的 ExpertAlign 指标通过评估教师纠正是否体现其专业化能力来加权信号。实验显示,ExpertAlign 在无标签和有标签数据的四种设置下均取得最佳性能,相比均值聚合提升显著,证明了令牌级路由能有效利用跨域互补监督。

  6. HuggingFace Daily Papers(社区热门论文)35

    ARGUS:基于语言模型的气候政策因果评估审计框架

    研究提出 ARGUS,一种结构化语言模型流水线,用于审计气候政策差分法(DID)研究中的识别假设证据。ARGUS 依据十一维假设-含义-证据准则进行评估,并在无法检索相关证据时选择弃权。在注入缺陷的基准测试中,ARGUS 检测到 73% 的植入缺陷,显著高于关键词基线的 18%。在经济学论文评估中,约 40% 的维度因缺乏可检索证据而弃权。该工具旨在为专家审查提供风险定位报告,而非直接裁定因果主张。代码与数据已开源。

  7. HuggingFace Daily Papers(社区热门论文)39

    提出连续深度批处理技术,实现循环语言模型的高效自适应推理

    针对循环语言模型(Looped LMs)中不同 token 循环次数不同导致无法使用标准批处理系统的问题,研究者提出了“连续深度批处理”(CDB)方法。该方法通过在循环步骤间动态构建新批次、管理 KV 缓存及预测退出时机,实现了高效的深度自适应推理。实验表明,全循环架构最适合此方法,CDB 可实现高达 99% 的预估最大加速比。

  8. Anthropic:Research(发表成果 · 网页)61

    Anthropic Project Swap 实验:201 名员工让 Claude 智能体替人换书交易

    Anthropic 开展 Project Swap 实验,让 201 名员工携带一本书,其 Claude 智能体在数字交易大厅代表他们谈判换书。5 分钟聊天后,Claude 构建的图书排序与本人自评排序在 61% 的书对上一致;市场效率为 0.55(最优 0.89),其中 85% 的差距来自智能体对参与者偏好的理解不足,而非谈判表现。

    推荐理由:实验设计能区分智能体理解偏好与谈判能力各自的贡献,结果显示短板主要在代表性而非谈判,模型强弱的影响大于指令。

  9. The Decoder:AI News(RSS)55

    FRI 中期报告:顶尖 AI 专家大幅低估领域进展速度

    Forecasting Research Institute 的中期报告显示,专家和超级预测员系统性低估了 AI 进展。AI 在 2025 年 7 月达到 IMO 金牌水平,比专家预测中位数提前五年;病毒学基准、网络安全基准和 Anthropic 约 1000 亿美元年化收入等指标也远超预测,如专家对 2026 年底 AI 公司最高 ARR 的中位数预测仅 200 亿美元。

9月24日周四