跳到正文

数据与训练

训练侧的门道:数据集构建、合成数据、预训练与后训练方法、算力与训练成本。

最新精选

第 1–20 条 · 共 25 条
今天10月8日周四
  1. Microsoft Research67

    微软研究院开源 Agent Lightning v1.0:3500 行轻量智能体 RL 框架,直接训练真实 harness

    微软研究院开源 Agent Lightning v1.0,这是一个约 3500 行代码的轻量智能体强化学习框架,提出 Harnessed Agentic RL 范式,让部署时使用的 agent harness 直接参与训练,无需在训练框架内重新实现 agent。

    推荐理由:微软研究院开源 Agent Lightning v1.0,用约 3500 行代码把真实 harness 直接接入强化学习训练,读者可了解其轻量化设计与训练收益。

10月2日周五
  1. NVIDIA Blog60

    NVIDIA 与 CoreWeave 将 Vera Rubin NVL72 投入生产,Cognition 为首家客户

    CoreWeave 宣布 NVIDIA Vera Rubin NVL72 系统搭配 Spectrum-X 102.4T 以太网在 CoreWeave Cloud 上可用,成为首批交付该平台的云厂商之一,Cognition 是首个在生产环境运行 Vera Rubin 的客户。

    推荐理由:CoreWeave 上线 Vera Rubin NVL72 并公布 Devin 实测吞吐数据,可看到智能体推理与后训练基础设施的落地形态。

  2. Google DeepMind71

    Google DeepMind 推出 SynthID Bio,为 AI 生成蛋白质嵌入可验证水印

    Google DeepMind 推出 SynthID Bio,将水印技术引入合成生物学,把不可感知的签名直接嵌入生物代码,使水印不仅能在数字模型上验证,也能在合成出的实体蛋白质上验证,同时保持其生物功能。

    推荐理由:SynthID 水印技术首次延伸到合成生物学,读者可了解 AI 生成蛋白质如何在保留功能的同时被标记与验证。

9月29日周二
  1. Hugging Face:Blog(RSS)67

    NVIDIA 发布开源表格基础模型 Kumo Tabular,在 TabArena 等四项基准排名第一

    NVIDIA 发布开源表格基础模型 Kumo Tabular,对带标签表格做单次前向推理即可完成分类和回归,无需训练、调参或特征工程。

    推荐理由:官方技术博客披露了架构、纯人工数据预训练配方和四项基准成绩,读者可据此评估其替换梯度提升树的可行性。

  2. AMD 官方77

    AMD 签署约 82 亿美元收购 World Labs 协议,李飞飞拟任首席科学家

    AMD 宣布以约 82 亿美元全股票交易收购 World Labs,双方已签署最终协议。交易完成后,李飞飞将出任 AMD 执行副总裁兼首席科学家,直接向苏姿丰汇报;预计今年底交割,仍需监管批准,不能视作已经完成。

    推荐理由:协议披露了世界模型团队与芯片平台整合的金额、路径和交割条件,为判断空间智能研发与算力布局的关系提供了新信息。

9月28日周一
  1. MIT News(RSS)78

    MIT利用AI算法优化RNA疫苗配方,实现室温稳定保存一年

    MIT研究人员借助AI算法优化脂质纳米颗粒(LNP)的辅料配比,成功开发出耐热性更强的RNA疫苗配方。该配方使疫苗在室温下可稳定保存一年,或在37摄氏度下保存两个月,且在小鼠实验中产生的免疫反应与Moderna类似。AI算法通过少量实验数据快速收敛至最优解,将原本需数月的筛选过程缩短至几周。相关成果发表于《Nature Biotechnology》。

    推荐理由:展示了AI在小数据集和复杂生物化学问题中的高效应用,显著加速了药物研发流程,具有明确的科学突破和实际应用价值。

  2. 小米 MiMo:官网发布与博客63

    小米 MiMo-V2.6 诊断并修复工具调用重复问题,用 MOPD 将修复成本降至 MixRL 方案的 4%

    小米官方复盘 MiMo-V2.6 发布后的工具调用重复问题,响应级重复率超 0.05%,并区分了正常并行调用、调用泛滥与调用重复。回放 RL 各 checkpoint 显示泛滥率随训练从 11.1% 升至 24.6%,32 次调用阈值惩罚过于宽松;直接调低阈值需重启 20 步 MixRL,估计成本 231 万美元,且内部测试重复率仅从 13.45% 降至 3.83%。

    推荐理由:原文给出完整的归因实验和修复路径,还公开了成本对比,读者可借鉴其诊断 RL 训练中涌现行为的方法。

9月24日周四
  1. NVIDIA Blog(RSS)61

    NVIDIA 联合 Google DeepMind 等机构开放 2800 多种病毒的蛋白复合物预测结构数据集

    NVIDIA 与 Google DeepMind、EMBL-EBI 等全球研究机构合作,通过 AlphaFold Database 开放发布 2800 多种病毒的蛋白复合物预测 3D 结构,旨在为下一次疫情储备知识。

    推荐理由:原文给出数据集规模、覆盖范围和可复用的开源预测流程,读者可以据此评估如何用于自己的蛋白结构研究。

  2. Anthropic:Newsroom(网页)76

    Anthropic 成立生命科学实验室,Claude 自主发现类 CRISPR 的新型酶系统 ART

    Anthropic 宣布成立生命科学研究组与实验室,Claude 智能体在仅有人类高层指导下自主发现一种与 DNA 重复序列相关、结构类似 CRISPR 的新型酶系统,命名为 array-associated reverse transcriptases(ART),并发布预印本。

    推荐理由:原文给出 Claude 发现新酶系统的具体过程与规模数据,读者可了解 AI 智能体如何参与基础生物学发现的工作方式。

9月22日周二
9月18日周五
  1. Anthropic:The Institute(旗舰研究长文 · 网页)73

    Anthropic 发布前沿 AI 开发节奏测量工具与内部指标快照

    Anthropic 发布一套测量前沿 AI 开发节奏的指标,覆盖 AI 主导研发、智能体监督和算力分配三方面。

    推荐理由:Anthropic 公开测量自身 AI 研发自动化程度、智能体监督和算力分配的方法与数据,读者可以看到前沿实验室透明度报告的一种可复用范式。

9月15日周二
  1. IT之家(RSS)77

    404 Media 曝光 OpenAI 莉莉计划:人工审核 ChatGPT 聊天记录以优化模型

    404 Media 披露 OpenAI 内部代号为莉莉计划(Project Lily)的项目,由时薪超 50 美元的提示词审核员查看匿名化后的真实用户聊天记录,评判回复是否切题、是否存在 AI 式话术和谄媚口吻。

    推荐理由:报道披露了人工审核流程的运作细节和隐私边界,读者可以据此了解模型优化背后的人力环节与数据风险。

9月12日周六
  1. Dwarkesh Patel:Podcast & Blog(RSS)67

    Beren Millidge、John Schulman、Charlie O'Neill 对谈递归自我改进离我们还有多远

    Dwarkesh Patel 与 Zyphra CTO Beren Millidge、Thinking Machines 首席科学家 John Schulman、Baseten 模型训练负责人 Charlie O'Neill 三位研究者对谈递归自我改进(RSI)的前景。

    推荐理由:三位一线研究者就递归自我改进的技术瓶颈、蒸馏与RL环境壁垒、参数规模趋势给出具体分歧和可检验预测。

9月11日周五
  1. Together AI 研究与产品博客(RSS)63

    Together AI 扩展微调服务:新增模型、实验跟踪与更细训练控制

    Together AI 扩展 Together Fine-Tuning 服务,新增对 GLM-5.3、Kimi K2.7、Qwen 3.5 系列等最新开源权重模型的支持,并上线实时实验跟踪、数据集预览验证等能力。

    推荐理由:原文给出新模型支持、Expert LoRA 实测对比、自动早停和降价幅度等具体细节,读者可据此评估微调工作流的实际改进。

9月10日周四
  1. OpenAI:官网动态(RSS · 排除企业/客户案例)63

    OpenAI 在 ChatGPT Work 中推出 Data agent

    OpenAI 在 ChatGPT Work 中推出新的 Data agent,用户用自然语言即可连接公司数据、分析变化并生成可分享的交互式仪表盘。

    推荐理由:官方公布了数据源和 BI 工具接入范围及权限管控方式,读者可据此评估它在自有数据工作流中的落地路径。

9月9日周三
  1. Anthropic:The Institute(旗舰研究长文 · 网页)64

    Anthropic 发布经济情景模型,推演 AI 对 2030 年美国就业与工资的影响

    Anthropic 经济团队基于技术报告《Economic Scenarios for Transformative AI》发布交互式经济情景探索工具,把经济表示为任务束,推演 AI 到 2030 年对美国经济的影响。

    推荐理由:原文给出模型化的三种经济情景和关键数字,读者可以据此理解AI对不同职业工资和就业的可能影响。

  2. Dwarkesh Patel:Podcast & Blog(RSS)60

    Dwarkesh Patel 研究:预训练进步主要来自数据改进

    Dwarkesh Patel 发布实验分析,在最高 1e19 FLOPs 的算力预算下训练 2019 至 2025 年各年度代表性模型配方与数据语料,发现数据改进带来 12.0x 算力效率提升,模型改进为 3.7x,数据贡献约为模型的 3.24 倍。

    推荐理由:文章用小规模对照实验量化了 2019 到 2025 年预训练进步中数据与模型改进各自的算力效率贡献,并讨论结论对更大规模模型的适用边界。

9月4日周五
  1. Hacker News 热门(buzzing.cc 中文翻译)78

    IFM 发布 K2 Horizon 六款开源模型,覆盖 0.9B 到 375B-A23B 并开放完整训练生命周期

    IFM 发布 K2 Horizon 模型系列,共六个模型:375B-A23B、36B-A4B、32B、7B、3.7B 和 0.9B,均以 Apache 2.0 开源,其中 0.9B、3.7B 和 7B 宣称在其规模上达到 SOTA,36B-A4B 采用新提出的稀疏注意力架构 MoVA。

    推荐理由:原文在发布模型之外还放出从预训练到智能体后训练的全流程产物,研究者可以据此复现和改造整套训练方法。