跳到正文

#数据/训练

今日 0 条
10月4日周日
10月2日周五
  1. Microsoft Research36

    微软研究院用机器学习预测电网空间天气风险,覆盖美国 66,935 座变电站

    微软研究院开发了一套端到端机器学习流水线,利用 L1 拉格朗日点的太阳风观测数据,为美国本土 66,935 座变电站生成 30-60 分钟前的空间天气风险预测。系统结合 AE 与 Dst 指数预测、地质电导率和电网数据,在 2020-2026 年评估期内检测到近 80% 的重大空间天气事件,其中 Dst 预测器在 62.2% 的高活跃时段优于 Burton 方程。

9月29日周二
  1. HuggingFace Daily Papers(社区热门论文)33

    FactorEngram:面向语言模型的基级门控分解式 N-gram 记忆

    FactorEngram 提出一种分解式 n-gram 记忆机制,用共享基向量字典上的稀疏系数替代传统单体嵌入,并让上下文对每个记忆分量单独门控。在 340M 和 1B 参数 Transformer 骨干上,该方法提升了语言建模与下游任务表现;消融实验显示,将记忆分支插入中间层的注意力子层之前是有效配置。

  2. HuggingFace Daily Papers(社区热门论文)30

    Nereus:面向 LLM 后训练的自适应并行运行时

    Nereus 是一个面向 LLM 强化学习后训练的成本感知运行时,可动态调整并行策略以适配资源、序列长度和内存压力的变化。在真实数据 trace 中,在线 TP/PP 自适应将平均 step 延迟降低 27.7%;在 1,024 GPU 的 1,000 步运行中,六次切换仅占总运行时间的 0.079%。

  3. HuggingFace Daily Papers(社区热门论文)44

    研究揭示 LLM 全流程为何默认偏向美式英语:1,813 组 AmE–BrE 变体与 DiAlign 方法

    研究以 1,813 组匹配的美式英语(AmE)与英式英语(BrE)变体为资源,提出免训练的 DiAlign 方法,从数据分布证据估计区域对齐度。AmE 在全部 6 个预训练语料和 21 个后训练数据集中均被偏好,tokenizer 表示更紧凑、预测成本更低,且在中性英语提示下仍是默认生成偏好;改用英式英语提示可向 BrE 偏移,但无法稳定消除 AmE 默认。

  4. HuggingFace Daily Papers(社区热门论文)30

    PLDR-LLM 的训练与推理动力学:行映射坍缩、重归一化与预测约简

    该专著提出 PLDR-LLM(幂律解码器表示语言模型)训练与推理的统一理论框架,用有限工作恒等式将行中心学习映射的绝对能量变化分解为参数贡献、带符号交互与数值观测缺陷。实验揭示了观测器与优化器依赖性,否定了所测试的自主行状态候选方案,并支持有限条件预测与状态特定的算子约简。理论区分了精确恒等式、条件动力学主张与有限实证发现,并给出证明、形式化检验与紧凑数值证据。

9月28日周一
  1. MIT News(RSS)78

    MIT利用AI算法优化RNA疫苗配方,实现室温稳定保存一年

    MIT研究人员借助AI算法优化脂质纳米颗粒(LNP)的辅料配比,成功开发出耐热性更强的RNA疫苗配方。该配方使疫苗在室温下可稳定保存一年,或在37摄氏度下保存两个月,且在小鼠实验中产生的免疫反应与Moderna类似。AI算法通过少量实验数据快速收敛至最优解,将原本需数月的筛选过程缩短至几周。相关成果发表于《Nature Biotechnology》。

    推荐理由:展示了AI在小数据集和复杂生物化学问题中的高效应用,显著加速了药物研发流程,具有明确的科学突破和实际应用价值。

  2. 小米 MiMo:官网发布与博客63

    小米 MiMo-V2.6 诊断并修复工具调用重复问题,用 MOPD 将修复成本降至 MixRL 方案的 4%

    小米官方复盘 MiMo-V2.6 发布后的工具调用重复问题,响应级重复率超 0.05%,并区分了正常并行调用、调用泛滥与调用重复。回放 RL 各 checkpoint 显示泛滥率随训练从 11.1% 升至 24.6%,32 次调用阈值惩罚过于宽松;直接调低阈值需重启 20 步 MixRL,估计成本 231 万美元,且内部测试重复率仅从 13.45% 降至 3.83%。

    推荐理由:原文给出完整的归因实验和修复路径,还公开了成本对比,读者可借鉴其诊断 RL 训练中涌现行为的方法。

9月27日周日
  1. HuggingFace Daily Papers(社区热门论文)42

    CompoWorld:面向通用智能体的组合式环境扩展框架

    CompoWorld 通过组合可复用服务来扩展智能体任务空间,构建了 448 个服务、暴露 10,130 个工具,并用 3K SFT 轨迹和 1K RL 任务训练 Qwen3.6-35B-A3B。实验显示其在八个基准上平均提升 9.17 分,在 AutomationBench 上超过 Claude Opus 4.6 等前沿模型,并领先所有对比的 35B-A3B 专用智能体模型。

  2. HuggingFace Daily Papers(社区热门论文)39

    SMAT:简单高效的合并感知训练方法

    研究者提出 SMAT(Simple MAT),通过将常见模型合并操作归纳为 Scale、Mask、Perturb 三种,联合优化专家损失与模拟合并参数下的期望损失,并引入周期性调度、算子融合和参数存储切换,使每步仅需一次前向和一次反向传播。在四个语言与视觉语言骨干模型上,SMAT 将五种合并方法的平均分较各骨干最强基线提升 1.07-2.16 分,训练时间开销较标准微调不足 2%。

9月26日周六
9月25日周五
  1. HuggingFace Daily Papers(社区热门论文)45

    ZooWork-ShopRanker:面向电商场景的偏好对齐重排序模型发布

    ZooWork团队发布ShopRanker系列电商重排序模型(0.6B/4B/8B),通过多LLM裁判生成偏好标签进行训练,并推出包含约1万条真实流量数据的ShopRank-Bench基准。实验显示该系列模型在电商检索任务上显著优于现有开源基线及未对齐版本,且小参数模型表现突出。目前模型与基准已开源。

  2. HuggingFace Daily Papers(社区热门论文)38

    MOPD-Router:多教师在线蒸馏中的令牌级路由新框架

    针对多教师在线蒸馏(MOPD)中依赖提示词级领域标签进行硬路由的局限,研究者提出 MOPD-Router 框架。该框架无需领域标签或独立路由模型,即可在每个令牌级别对全教师池的监督信号进行路由。其中提出的 ExpertAlign 指标通过评估教师纠正是否体现其专业化能力来加权信号。实验显示,ExpertAlign 在无标签和有标签数据的四种设置下均取得最佳性能,相比均值聚合提升显著,证明了令牌级路由能有效利用跨域互补监督。

9月24日周四
  1. HuggingFace Daily Papers(社区热门论文)52

    JitMem 提出读取时任务自适应记忆整理方法,提升 LLM 智能体表现

    论文提出 Just-in-Time Memory(JitMem),保留原始轨迹并把记忆整理推迟到读取时,由整理器根据当前任务合成任务自适应的紧凑载荷。在 ALFWorld、WebShop 和 τ^2-bench 上,JitMem 分别超过最强基线 16.2、16.3 和 3.9 个绝对成功率点,未训练的整理器也已与基线相当或更优。

  2. HuggingFace Daily Papers(社区热门论文)57

    上海AI实验室发布 InternW0 物理世界模型基础版

    上海AI实验室推出 InternW 物理世界模型系列的首个模型 InternW0,通过非对称视频动作架构结合 flow matching 联合学习未来视觉动态与连续机器人控制,视频专家提供长时程预测上下文,轻量动作专家以更快频率运行,并通过复用层间 K/V 和观察条件上下文路由避免每次动作更新都重新生成未来。

  3. Anthropic:Newsroom(网页)76

    Anthropic 成立生命科学实验室,Claude 自主发现类 CRISPR 的新型酶系统 ART

    Anthropic 宣布成立生命科学研究组与实验室,Claude 智能体在仅有人类高层指导下自主发现一种与 DNA 重复序列相关、结构类似 CRISPR 的新型酶系统,命名为 array-associated reverse transcriptases(ART),并发布预印本。

    推荐理由:原文给出 Claude 发现新酶系统的具体过程与规模数据,读者可了解 AI 智能体如何参与基础生物学发现的工作方式。

9月23日周三
  1. HuggingFace Daily Papers(社区热门论文)53

    Learning to Discover Interesting Mathematics:用有趣度指标引导模型自动发现数学定理

    论文提出用证明长度与陈述长度之比衡量定理的内在有趣度,并证明其与下游实用性相关。作者训练了一个 27B 模型预测证明难度,准确率超过前沿通用模型;按该指标优化后,生成定理与 Mathlib 的实质性或完全重合率从 91.9% 降至 30.6%,系统可迭代构建自扩展的机器验证数学库。

9月22日周二
9月21日周一
9月20日周日
  1. HuggingFace Daily Papers(社区热门论文)45

    研究提出压缩深度是层级结构的特征,而非空白符

    该研究指出标准位置编码无法确定文本的层级结构。作者使用分层旋转位置编码(hRoPE),通过干预段落坐标并测量跨段落注意力,发现真实结构表现为更深的注意力压缩,且这种压缩深度具有语料依赖性。相比之下,随机标签的控制组虽然也有压缩,但深度较浅且不具语料依赖性。研究表明,压缩深度而非其位置,是识别真实段落结构的可靠特征。

  2. HuggingFace Daily Papers(社区热门论文)55

    PsPLUG:解决个性化LLM中显式风格与隐式偏好冲突的轻量插件

    研究发现,在个性化大语言模型中,显式的风格指令可能会破坏用户特定的特征(即“个性化崩溃”)。为此提出 PsPLUG,一种轻量级插件,通过学习扣除请求风格后的用户特定残差来平衡两者。实验表明,PsPLUG 能在提供精确风格控制的同时,更好地保留用户偏好。