跳到正文

#数据/训练

今日 2 条
9月24日周四
  1. NVIDIA Blog(RSS)61

    NVIDIA 联合 Google DeepMind 等机构开放 2800 多种病毒的蛋白复合物预测结构数据集

    NVIDIA 与 Google DeepMind、EMBL-EBI 等全球研究机构合作,通过 AlphaFold Database 开放发布 2800 多种病毒的蛋白复合物预测 3D 结构,旨在为下一次疫情储备知识。

    推荐理由:原文给出数据集规模、覆盖范围和可复用的开源预测流程,读者可以据此评估如何用于自己的蛋白结构研究。

  2. HuggingFace Daily Papers(社区热门论文)52

    JitMem 提出读取时任务自适应记忆整理方法,提升 LLM 智能体表现

    论文提出 Just-in-Time Memory(JitMem),保留原始轨迹并把记忆整理推迟到读取时,由整理器根据当前任务合成任务自适应的紧凑载荷。在 ALFWorld、WebShop 和 τ^2-bench 上,JitMem 分别超过最强基线 16.2、16.3 和 3.9 个绝对成功率点,未训练的整理器也已与基线相当或更优。

  3. HuggingFace Daily Papers(社区热门论文)57

    上海AI实验室发布 InternW0 物理世界模型基础版

    上海AI实验室推出 InternW 物理世界模型系列的首个模型 InternW0,通过非对称视频动作架构结合 flow matching 联合学习未来视觉动态与连续机器人控制,视频专家提供长时程预测上下文,轻量动作专家以更快频率运行,并通过复用层间 K/V 和观察条件上下文路由避免每次动作更新都重新生成未来。

  4. Anthropic:Newsroom(网页)76

    Anthropic 成立生命科学实验室,Claude 自主发现类 CRISPR 的新型酶系统 ART

    Anthropic 宣布成立生命科学研究组与实验室,Claude 智能体在仅有人类高层指导下自主发现一种与 DNA 重复序列相关、结构类似 CRISPR 的新型酶系统,命名为 array-associated reverse transcriptases(ART),并发布预印本。

    推荐理由:原文给出 Claude 发现新酶系统的具体过程与规模数据,读者可了解 AI 智能体如何参与基础生物学发现的工作方式。

  5. The Verge:AI(RSS)66

    Anthropic 称近 950 个 Claude 智能体自主发现类似 Crispr 机制的新酶系统

    Anthropic 称其湿实验室的首个成果中,Claude 自主发现了一个新酶系统,并类比 Crispr 背后的基因编辑机制。约 950 个 Claude 智能体在 21 小时内处理 2.1 亿 token,从大规模 DNA 序列数据库中标记出异常重复模式,经人类科学家分析和实验确认为噬菌体中此前未被表征的酶系统。

9月23日周三
  1. Rohan Paul64

    FT 报道称中国正考虑对 Broadcom 交换机采取限制措施,这类交换机在国资背景数据中心部署中占比可能高达 90%。国务院国资委近几周调查了国有控制数据中心对 Broadcom 的使用情况,审查针对 AI 基础设施中在训练和推理期间加速器之间传输数据的高速交换机,背景是推动国产厂商发展、降低对外国 AI 基础设施的依赖。

  2. HuggingFace Daily Papers(社区热门论文)53

    Learning to Discover Interesting Mathematics:用有趣度指标引导模型自动发现数学定理

    论文提出用证明长度与陈述长度之比衡量定理的内在有趣度,并证明其与下游实用性相关。作者训练了一个 27B 模型预测证明难度,准确率超过前沿通用模型;按该指标优化后,生成定理与 Mathlib 的实质性或完全重合率从 91.9% 降至 30.6%,系统可迭代构建自扩展的机器验证数学库。

  3. TechCrunch:AI(RSS)59

    Snorkel AI 完成 3.5 亿美元 E 轮融资,估值升至 35 亿美元

    Snorkel AI 完成 3.5 亿美元 E 轮融资,由 Insight Partners 和 S32 领投,估值 35 亿美元,约为 17 个月前 D 轮 13 亿美元估值的近三倍。公司称年化收入达 3.75 亿美元,过去 12 个月增长 18 倍,主要来自 AI 实验室对高端训练数据的需求;其 RL 环境和数据集业务中支付给人类专家的费用计入成本,而非总年化收入。

9月22日周二
  1. 404 Media(RSS)58

    404 Media:OpenAI 模型训练外包人员因用 AI 训练 AI 被解雇

    404 Media 调查发现,多名受雇改进 OpenAI 模型的外包承包商因用 AI 生成内容来完成训练工作被解雇。这些承包商负责阅读真实 ChatGPT 用户的提示词等数据以改进模型回答;有承包商称此类违规“随时有人在犯,也随时有人因此被开除”,作者指出 AI 生成文本回流训练可能加剧“模型坍塌”问题。

  2. IT之家(RSS)65

    阿里吴泳铭宣布全力投入 AI 基础设施,目标 2032 年阿里云全球数据中心规模超 20GW

    2026 云栖大会上,阿里巴巴 CEO 吴泳铭表示客户 AI 需求强劲,将全力投入 AI 基础设施建设,目标到 2032 年阿里云运营的全球数据中心规模超过 20GW。他指出 AI 模型、AI 芯片和 AI 云是机器智能时代三大基石,董事会主席蔡崇信透露阿里正搭建覆盖芯片、云、模型服务、智能体应用的五层协同架构,并计划训练一款参数量为 5 万亿至 10 万亿的 AI 模型。

  3. Hacker News 热门(buzzing.cc 中文翻译)52

    提出 Spymark 概念:隐藏在媒体中的追踪信号不是水印

    作者 Brandon Thomas 提出 Spymark 一词,指嵌入媒体、可在用户不知情下追踪来源的隐性信号,以区别于传统可见水印。他以 Google SynthID 为例,其 SynthID-O 可在 512x512 图像中编码 136-bit 载荷,足以容纳 64-bit 数据库标识符加纠错位;音频、文本同样可被嵌入追踪信号,且部分可抗压缩与编辑。

  4. Nathan Lambert67

    小米 MiMo-V2.6 系列发布,MiMo-V2.6-Pro 为 1.02T 总参数、42B 激活,MiMo-V2.6-Flash 为 310B 总参数、15B 激活。推文称其为 Artificial Analysis 上的开源模型榜首,并附 RL dashboard 和技术报告。报告称该全模态系列通过扩展 RL 算力追求模型自我改进,异步训练每步消耗 1,568 个样本、2.7~3.7B token,上下文最长 1M,并开源训练动态、RL 环境和 RL 框架。

9月21日周一
9月20日周日
  1. HuggingFace Daily Papers(社区热门论文)45

    研究提出压缩深度是层级结构的特征,而非空白符

    该研究指出标准位置编码无法确定文本的层级结构。作者使用分层旋转位置编码(hRoPE),通过干预段落坐标并测量跨段落注意力,发现真实结构表现为更深的注意力压缩,且这种压缩深度具有语料依赖性。相比之下,随机标签的控制组虽然也有压缩,但深度较浅且不具语料依赖性。研究表明,压缩深度而非其位置,是识别真实段落结构的可靠特征。

  2. HuggingFace Daily Papers(社区热门论文)55

    PsPLUG:解决个性化LLM中显式风格与隐式偏好冲突的轻量插件

    研究发现,在个性化大语言模型中,显式的风格指令可能会破坏用户特定的特征(即“个性化崩溃”)。为此提出 PsPLUG,一种轻量级插件,通过学习扣除请求风格后的用户特定残差来平衡两者。实验表明,PsPLUG 能在提供精确风格控制的同时,更好地保留用户偏好。

  3. HuggingFace Daily Papers(社区热门论文)55

    CARD:基于集群适配与奖励引导解码的个性化文本生成框架

    CARD提出一种分层框架,通过聚类用户风格模式并学习组特定LoRA适配器实现可扩展的个性化。其核心机制包括隐式偏好学习(对比用户文本与组生成结果)以及推理时仅通过轻量级用户偏好向量和低秩logit校正注入个性化,保持基础模型冻结。实验显示其在LaMP基准上优于基线,同时提升了效率与可扩展性。

9月19日周六
  1. Epoch AI:研究、数据与评测54

    Epoch AI 分析:数学预印本中致谢 AI 使用的比例从4月的4%升至8月的25%

    Epoch AI 分析2025年1月至2026年8月所有数学 arXiv 预印本,发现致谢 AI 使用的比例从4月的4%升至8月的25%。方法是用 AI 关键词筛选后由 GPT-5.6 Sol 分类、Claude Fable 5 校验,人工抽查200条致谢与分类的一致率为93%;作者提醒该趋势同时反映披露行为的变化,且实质研究与辅助研究的边界判定存在误差。

9月18日周五
  1. IT之家(RSS)59

    北京发布“词元经济十条”,部署词元工厂建设与关键技术攻关

    北京市经济和信息化局9月18日发布“词元经济十条”,即《北京市加快词元经济发展的行动方案(2026—2028年)》。方案提出高标准建设词元工厂,制定覆盖模型适配数量、词元吞吐速度、首字延迟、缓存命中率、PUE 等指标的分级评价标准;推动推理专用芯片、模型轻量化、边缘端部署等技术攻关;并部署词元质量评测体系、词元分发平台、通用与垂直领域智能体培育、算力与词元金融工具及词元工程师再技能化培训等措施。