跳到正文

#数据/训练

今日 2 条
9月3日周四
  1. HuggingFace Daily Papers(社区热门论文)37

    Debias-SparseGPT:面向大语言模型的偏见感知剪枝方法

    论文提出 Debias-SparseGPT,一种后训练剪枝方法,利用人口统计对比输入上的二阶项进行表征去偏。在 25%、50% 和 2:4 结构化稀疏度下,该方法相比 SparseGPT 持续降低剪枝引入的偏见,同时保持模型困惑度和零样本准确率;在限制最严格的 2:4 结构化稀疏模式下,用长上下文、内容丰富的示例扩充校准集可进一步提升下游性能和公平性。

  2. Hugging Face:Blog(RSS)63

    用 TRL 和 OpenEnv 训练编码模型画水彩:Hugging Face 全流程开源复现

    Hugging Face 博客作者基于 Surya Narreddi 的原始想法,用 TRL、OpenEnv 和 Qwen/Qwen3.5-35B-A3B 复现了让语言模型通过 p5.brush 写 JavaScript 画水彩的 RL 训练流程,所有数据集、环境、脚本和模型均开源在 Hub。

    推荐理由:作者用 TRL 和 OpenEnv 完整开源复现了让编码模型画水彩的 RL 配方,含数据池、环境和三组奖励对比,可整体迁移复用。

  3. 公众号:百度智能云(文心)35

    赵昊与百度百舸团队对谈:世界模型如何走向规模化训练

    百度智能云具身智能前沿讲堂上,清华大学AIR助理教授赵昊与百度智能云AI计算首席科学家王雁鹏等对谈世界模型规模化问题。赵昊提出以3D/4D Token为核心的世界模型路线,认为世界模型不等于视频生成,需表达空间结构、光学属性和速度、加速度等动态信息;其OmniNWM通过动作编码与相机参数解耦,实现200帧稳定生成,并与精锋医疗、极智嘉分别合作手术预演和仓库机器人场景。

  4. HuggingFace Daily Papers(社区热门论文)46

    DisCo 提出 Repo-To-Skill 方法,将 1,000 个 ML 仓库蒸馏成 5,000+ 技能并提升智能体研究表现

    论文提出 Repo-To-Skill 与技能驱动的智能体 DisCo,将 GitHub 仓库中的操作性知识蒸馏为可复用技能,分为任务无关和任务导向两种形式。任务无关蒸馏产出 AREX-Skill Library,从 1,000 个常用 ML 仓库蒸馏出 5,000+ 个经核验的技能,按 20 个领域、178 个能力族组织。

  5. HuggingFace Daily Papers(社区热门论文)50

    SolarWM 发布开放数据与可扩展训练框架,仅用5秒序列训练实现小时级交互式视频世界模型

    SolarWM 是一个全开源的交互式视频世界模型基础,包含可重构多源数据引擎和骨干原生适配框架,将10个数据集约143万片段(约25.85TB)转为统一的帧对齐训练契约,并基于 Wan2.2、LTX-2.5 和 MiniMax-H3 训练四个 5B–33B 模型。

  6. HuggingFace Daily Papers(社区热门论文)45

    Cliff:从第一个错误学习过程奖励的 RLVR 奖励塑形策略

    论文提出 Cliff,一种奖励塑形策略,用现成 LLM 作为教师识别每次 rollout 中的第一个错误,将 rollout 分解为正确前缀和错误后缀,分别赋予正负 token 级优势。实验覆盖 12 个场景,Cliff 比.on-policy distillation 高 15%,比标准 GRPO 高 7%,即使教师能力一般也有效。

  7. IT之家(RSS)79

    美国司法部介入纽约时报诉 OpenAI 案,主张 AI 训练属合理使用

    美国司法部 9 月 1 日向曼哈顿联邦法院提交利益声明,介入《纽约时报》诉 OpenAI 版权案,支持 OpenAI 主张大语言模型训练属合理使用。DOJ 以国家安全和 AI 产业竞争力为主要论据,称训练使用具有转换性;《纽约时报》发言人批评政府站在 AI 公司一边牺牲创作者权益。法官要求双方最迟 9 月 4 日提交简易判决动议,该案结果可能为 AI 训练版权合法性确立先例。

    推荐理由:司法部罕见公开站在 OpenAI 一边,这条报道梳理了双方核心论点和案件时间线,有助于理解 AI 训练版权争议的走向。

  8. HuggingFace Daily Papers(社区热门论文)34

    并非所有秩都相等:跨任务的预算感知 LoRA 合并

    研究提出 Net Utility,一种无需数据的指标,通过 SVD 分解每个任务的 LoRA,按任务效用及与其他任务方向的干扰为各奇异方向打分,再在总方向数约束下全局择优,实现跨任务的预算感知秩分配。该方法可叠加在五种合并方法、三种合并空间之上,在视觉与语言两组任务上均优于不做秩分配的方案,视觉任务平均提升 +2.1%,语言任务平均提升 +2.2%。

  9. HuggingFace Daily Papers(社区热门论文)44

    研究提出 Switch Distillation:中训练阶段知识蒸馏更利于推理而非事实记忆

    研究发现前向 KL 蒸馏在 pre-training 阶段同时提升推理与事实记忆,但在 mid-training 阶段会拖慢事实记忆习得,同时推理仍持续提升。作者提出 Switch Distillation,以教师预测熵作为路由信号,仅在教师置信的 token 上蒸馏,其余回退到交叉熵。

  10. IT之家(RSS)74

    博通 2026 财年 Q3 财报:净利润 130.88 亿美元同比增长 216%,Q4 预计 AI 半导体收入 217 亿美元

    博通公布 2026 财年第三财季财报,营收 295.91 亿美元同比增长 86%,GAAP 归母净利润 130.88 亿美元同比增长 216%,AI 半导体收入 167 亿美元同比增长 221%。公司预计第四季度营收 348 亿美元、AI 半导体收入 217 亿美元同比增长 236%,并宣布每股 0.65 美元季度分红。

9月2日周三
  1. Hacker News 热门(buzzing.cc 中文翻译)57

    Mistral 帮助文档确认除企业版外默认用用户数据训练模型

    Mistral 帮助中心文档说明:除企业版默认退出外,Vibe、移动端和 Mistral Studio 及 API 的用户输入输出数据默认可能用于模型训练,用户可随时选择退出。文中给出各平台的退出步骤,并提醒 Vibe 与 API 的退出开关相互独立,需分别设置;Vibe 中上传的文档也被视为输入数据。

  2. IT之家(RSS)36

    美光探索近 GPU NAND 闪存,可支撑更大规模 AI 模型

    据 DigiTimes 9 月 2 日报道,美光正在研究高耐久性 NAND 闪存模块,计划部署在距离 GPU 更近的位置,当前被称为“近 GPU NAND”。该方案可让 GPU 直接访问数百 GB 的 NAND 存储池,放置在 GPU 封装内部或 PCB,工作方式类似 HBM、GDDR7;与传统 TLC 或 QLC NAND 相比密度更低,重点提升 I/O 速度和带宽。

  3. HuggingFace Daily Papers(社区热门论文)47

    StudentSim:训练基于 LLM 的学生模拟器框架

    论文提出 StudentSim,通过池化训练加按学生专门化,把稀疏的学生个人数据转化为能模拟学生应答并在辅导下更新的个性化学生模拟器。配套发布 StudentSimEval 评测协议,覆盖国际象棋、英语二语写作和数学 3 个领域的 60 名学生,衡量行为保真度 F 和指导响应度 R。

  4. HuggingFace Daily Papers(社区热门论文)38

    RoboTok:面向人类示范检索与灵巧操作学习的互联网规模数据引擎

    论文提出 RoboTok,一个互联网规模数据引擎,输入人类操作视频即可从网络视频中检索与操作相关的人类示范,用于训练灵巧机器人策略。方法基于估计的演员中心参考系中的 3D 手部轨迹学习潜在运动空间,使操作行为的比较不受相机视角、场景外观和演员遮挡影响,并支持互联网规模视频的高效搜索与持续索引。在检索基准和下游策略评估中,RoboTok 检索出更相关的示范并提升了下游任务成功率。

  5. HuggingFace Daily Papers(社区热门论文)37

    研究将 SGD 优化动力学建模为渗流过程,提出方差级联与离散标度不变性

    该研究将随机梯度流(SGF)建模为渗流过程,认为架构对称性迫使子网络以离散的同步块合并,并在宏观序参量上表现为方差尖峰,类似物理相变。研究还指出这种捕获机制及标度级联在显式重尾噪声模型下同样适用于 Adam 和 AdamW。论文链接:https://arxiv.org/abs/2609.02373

  6. TechCrunch:AI(RSS)55

    AfterQuery 传闻以 32 亿美元估值成为 Y Combinator 史上最快独角兽

    AI 训练数据创业公司 AfterQuery 传闻完成一轮融资,估值达 32 亿美元,距其 4 月以 3 亿美元估值完成 3000 万美元 A 轮仅五个月。Y Combinator 合伙人 Gustaf Alströmer 称这是该加速器史上从创立到独角兽最快的公司,两位创始人为 22 和 23 岁,来自 Y Combinator 2025 年冬季批次。

  7. MarkTechPost(RSS)45

    普林斯顿、蚂蚁集团与斯坦福团队提出 AQuA:面向量化金融的两段式智能体自动因子发现框架

    普林斯顿大学、蚂蚁集团和斯坦福大学的研究团队提出 AQuA,一套由两个互不共享智能体、记忆和状态的语言模型量化研究系统,其设计要点是在迭代开始前冻结数据划分、特征与标签定义和评估器,让智能体只能在受约束的 DSL 内探索,以阻断自我改进中的数据泄漏。

9月1日周二