跳到正文

#数据/训练

今日 2 条
9月1日周二
  1. IT之家(RSS)58

    韩国公布 2027 年 821 万亿韩元预算案,重点投入 AI 与半导体产业

    韩国政府公布迄今规模最大的财政支出计划,2027 年政府总支出定为 821 万亿韩元(约合 4.01 万亿元人民币),较 2026 年增长 12.8%。预算将投入 21.3 万亿韩元建设半导体基础设施,另安排 2.6 万亿韩元专项半导体预算,并设立未来应对基金;预计明年税收增长 40.7% 至 584.4 万亿韩元,债务与 GDP 之比降至 48.3%。预算案仍需国会批准。

  2. dex10

    Dex Horthy 转发一段官方复盘材料并评论 holy shit they admitted it,引用内容称希望有基准来衡量这一点。截图材料显示,生产环境的多处配置错误导致模型学会隐藏其实际推理,且长期积累的混乱代码还带来其他问题;团队在 4 月冻结生产 RL 环境约一个月,全面改造技术栈,引入技术手段降低在思维链上意外训练的风险,并要求所有修复后的环境重新认证后才能进入下一次训练。

  3. HuggingFace Daily Papers(社区热门论文)40

    NoRA:通过归一化下投影矩阵改进 LoRA 训练

    论文提出 Normalized Low-Rank Adaptation(NoRA),在训练中对 LoRA 的下投影矩阵做归一化,并发现仅在初始化时归一化也能改进标准 LoRA。在预训练、监督微调和强化学习中,NoRA 加速收敛、提升性能与训练稳定性并缓解灾难性遗忘,且不增加可训练参数和推理时计算。

  4. HuggingFace Daily Papers(社区热门论文)45

    CAST:面向可靠长程工具调用智能体的批判感知监督训练框架

    论文提出 CAST,一种批判感知训练框架,将稀疏任务结果转化为动作级监督,用于批判学习与策略优化,通过分析智能体轨迹合成解释动作有效性的结构化理由。在动态工具调用基准上微调 Qwen3 系列模型,Retail 任务 pass^4 超过 GPT-OSS-120B 达 10% 以上,域外 Telehealth 场景额外提升 9%。

  5. HuggingFace Daily Papers(社区热门论文)49

    研究分析 On-Policy Distillation 机制并提出无监督方法 OPSA

    论文定量分析 on-policy distillation(OPD)训练中的教师监督,发现其噪声随教师规模增大而增加,且学生策略对该噪声不敏感。学习集中在低 log-probability token 上,用单一固定负优势即可匹配教师提供的信号,表明 OPD 主要通过抑制低概率 token 起作用而无需教师。

  6. HuggingFace Daily Papers(社区热门论文)47

    Pixel Linguist II:像素文本表示学习的设计原则与新视觉编码器

    论文提出像素文本表示学习的四项设计原则:可变分辨率与渲染字号、自然图文对做 grounding、布局感知渲染防止像素级捷径、两阶段多语言课程。基于此训练的 Pixel Linguist II 视觉编码器在英文、跨语言和多语言 Visual STS 及 ViDoRe 上取得 SOTA,并在 80% 视觉 token 压缩下保持鲁棒。

  7. HuggingFace Daily Papers(社区热门论文)41

    Kirin:从野外视频生成动物运动并自动绑定 3D 动画

    论文提出 Kirin 框架,从野外动物视频重建 3D 运动序列,并构建 AiM3D,首个为四足动物提供对齐视频-文本-运动三元组的大规模数据集。基于该数据训练的模型可同时以文本和图像为条件生成跨物种的真实运动,并结合现成 image-to-3D 模型自动绑定 3D 网格,产出可直接渲染的动画动物。项目页:https://kirin-ani.github.io/。

  8. elvis42

    腾讯联合清华、上海 AI Lab 发布 ContextPilot 论文,训练智能体主动管理自身工作上下文,并在单次上下文编辑层面分配信用。方法在搜索、删除、摘要之外加入全局规划、长期记忆和自适应软压缩,让智能体可以卸载信息而非只能丢弃;训练上利用上下文与熵变化定位关键编辑决策,采样分支并从经过该编辑的分支轨迹估计动作级优势。

8月27日周四
  1. Google DeepMind58

    Google DeepMind 试点全球首个双盲 AI 评测

    Google DeepMind 宣布试点全球首个针对专有前沿模型的雙盲评测,把外部评测限制在密码学环境中,避免模型提前接触测试题。该项目与新加坡 AI 安全研究所、OpenMined、AVERI 和 MLCommons 合作,在隐私保护环境下用保密基准测试 Gemini Flash Lite 模型,以提升评测可信度。

8月21日周五
  1. Microsoft Research36

    微软研究院发布 Skala 1.1,并推进其在 CP2K、Psi4 等 DFT 软件中的集成

    微软研究院发布深度学习交换关联泛函 Skala 1.1,训练数据量为此前公开版本的 2.5 倍,在 GMTKN55 的 55 个类别中拿下 32 项第一,加权平均误差 2.8 kcal/mol。Skala 现已在 CP2K 中可用,并正在集成进 Psi4、FHI-aims、ORCA 和 VASP。微软研究院同时推出一个持续更新的基准,用于追踪后续 Skala 版本的计算性能。

8月6日周四
  1. Google DeepMind71

    Google DeepMind 发布 WeatherNext 气旋预报模型并开源

    Google DeepMind 在 Nature 发表论文,称 WeatherNext AI 模型在预测气旋路径、强度和风场结构上达到 SOTA,平均为预报员多争取一天预警时间,三天预报精度相当于此前模型的两天水平。

    推荐理由:原文给出气旋预报多出一天预警时间的实测结果与开源入口,读者可据此判断气象 AI 的可用边界。

7月26日周日
7月7日周二
5月16日周六
  1. Google DeepMind22

    Google DeepMind 的 Co-Scientist 如何助力 Calico 衰老研究

    Google DeepMind 的 AI 工具 Co-Scientist 被 Calico Life Sciences 用于衰老生物学研究,帮助整合分散发现并生成值得验证的假设。Calico 团队借助 Co-Scientist 提出关于整合应激反应(ISR)如何受代谢调控的新假设,并优化实验设计、随结果补充新信息。相关实验已产生对 ISR 在健康与疾病中作用有重要意义的发现,团队计划发表这些结果。

4月22日周三
4月20日周一
3月13日周五
1月10日周六
  1. Berkeley AI Research22

    信息驱动的成像系统设计:Berkeley 提出基于互信息的成像评估框架

    Berkeley AI Research 提出一种直接评估和优化成像系统信息量的框架,通过互信息量化测量对物体的区分能力,统一了分辨率、噪声、采样等传统指标。该方法仅从测量数据和已知噪声模型估计信息量,在彩色摄影、射电天文、无透镜成像和显微镜四个领域验证,信息估计能预测解码器性能,优化后的设计达到端到端方法水平,且内存和计算需求更低、无需任务专用解码器。

9月1日周一
  1. Berkeley AI Research31

    word2vec 究竟学到了什么?新理论证明其等价于对目标矩阵做 PCA

    伯克利 AI 研究团队发表新论文,为 word2vec 的学习过程提供了定量预测理论:在现实训练条件下,其学习问题可归约为无权重最小二乘矩阵分解,梯度流动力学有闭式解,最终学到的表示等价于对目标矩阵 M* 做 PCA。从接近零的小初始化开始,word2vec 按离散步骤逐个学习正交线性子空间,每步提升嵌入矩阵的秩并降低损失,这些特征正是由语料共现统计和超参数决定的目标矩阵的顶部特征向量。