#数据/训练
#数据/训练
今日 2 条
Greg Brockman@gdbAI 评分5050
Thomas Wolf@Thom_WolfAI 评分5555HuggingFace Daily Papers(社区热门论文)AI 评分4444 研究揭示 LLM 全流程为何默认偏向美式英语:1,813 组 AmE–BrE 变体与 DiAlign 方法
研究以 1,813 组匹配的美式英语(AmE)与英式英语(BrE)变体为资源,提出免训练的 DiAlign 方法,从数据分布证据估计区域对齐度。AmE 在全部 6 个预训练语料和 21 个后训练数据集中均被偏好,tokenizer 表示更紧凑、预测成本更低,且在中性英语提示下仍是默认生成偏好;改用英式英语提示可向 BrE 偏移,但无法稳定消除 AmE 默认。
HuggingFace Daily Papers(社区热门论文)AI 评分3030 PLDR-LLM 的训练与推理动力学:行映射坍缩、重归一化与预测约简
该专著提出 PLDR-LLM(幂律解码器表示语言模型)训练与推理的统一理论框架,用有限工作恒等式将行中心学习映射的绝对能量变化分解为参数贡献、带符号交互与数值观测缺陷。实验揭示了观测器与优化器依赖性,否定了所测试的自主行状态候选方案,并支持有限条件预测与状态特定的算子约简。理论区分了精确恒等式、条件动力学主张与有限实证发现,并给出证明、形式化检验与紧凑数值证据。
elvis@omarsar0AI 评分4444Databricks:Blog(RSS)AI 评分2727 Databricks 如何连接制造业产品价值链的数据与 AI
Databricks 提出用 Data and AI Platform 打通制造业产品价值链各环节的数据,让跨阶段问题从人工查票变成一次查询。平台通过 zero-copy Open Sharing 和 Lakehouse Federation 直接访问源系统数据,无需为每个用例新建 ETL 管道或复制数据;需要镜像时可用连接器和云对象存储将数据汇入 lakehouse。
AMD 官方精选AI 评分7777 AMD 签署约 82 亿美元收购 World Labs 协议,李飞飞拟任首席科学家
AMD 宣布以约 82 亿美元全股票交易收购 World Labs,双方已签署最终协议。交易完成后,李飞飞将出任 AMD 执行副总裁兼首席科学家,直接向苏姿丰汇报;预计今年底交割,仍需监管批准,不能视作已经完成。
推荐理由:协议披露了世界模型团队与芯片平台整合的金额、路径和交割条件,为判断空间智能研发与算力布局的关系提供了新信息。
Apple Machine Learning Research(RSS)AI 评分3535 Apple 研究提出 LIPPAX 算法,改进联邦变分不等式的收敛速率
Apple 研究者针对联邦随机变分不等式(VI)提出改进收敛速率:先证明经典 Local Extra SGD 在光滑单调 VI 下经更精细分析可得更紧的保证,随后指出其客户端漂移过大的固有缺陷。
Aravind Srinivas@AravSrinivasAI 评分2929一个做研究的机会:持续学习:多智能体并行 worker;以及合成数据、环境和评测,用来衡量前沿能力。我们赚的钱足以资助新研究,希望做出持久的贡献,并公开分享我们的研究。
Rohan Paul@rohanpaul_aiAI 评分4646
Databricks:Blog(RSS)AI 评分3838 营销与数据工程最常误解的 24 个营销数据术语
Databricks 博客梳理了营销与数据工程团队最常理解不一致的 24 个营销数据术语,围绕活动数据来源、客户身份、受众就绪、激活等五个实际问题展开。文章以“inactive customers”“real-time”等为例,说明同一术语在双方眼中的定义差异会直接影响构建内容、成本与上线时间,并建议在开工前先对齐含义。全部 24 个术语可通过可打印 PDF 获取。
SemiAnalysis@SemiAnalysis_AI 评分3333IT之家(RSS)AI 评分5757 消息称小米大模型负责人罗福莉晋升至 22 级,已是小米职级体系最高级别
据晚点 LatePost 消息,小米 9 月 22 日对内发布晋升名单,31 岁的大模型团队负责人罗福莉晋升至 22 级,接近小米的人士称这已是小米职级体系最高级别。
MIT News(RSS)精选AI 评分7878 MIT利用AI算法优化RNA疫苗配方,实现室温稳定保存一年
MIT研究人员借助AI算法优化脂质纳米颗粒(LNP)的辅料配比,成功开发出耐热性更强的RNA疫苗配方。该配方使疫苗在室温下可稳定保存一年,或在37摄氏度下保存两个月,且在小鼠实验中产生的免疫反应与Moderna类似。AI算法通过少量实验数据快速收敛至最优解,将原本需数月的筛选过程缩短至几周。相关成果发表于《Nature Biotechnology》。
推荐理由:展示了AI在小数据集和复杂生物化学问题中的高效应用,显著加速了药物研发流程,具有明确的科学突破和实际应用价值。
小米 MiMo:官网发布与博客精选AI 评分6363 小米 MiMo-V2.6 诊断并修复工具调用重复问题,用 MOPD 将修复成本降至 MixRL 方案的 4%
小米官方复盘 MiMo-V2.6 发布后的工具调用重复问题,响应级重复率超 0.05%,并区分了正常并行调用、调用泛滥与调用重复。回放 RL 各 checkpoint 显示泛滥率随训练从 11.1% 升至 24.6%,32 次调用阈值惩罚过于宽松;直接调低阈值需重启 20 步 MixRL,估计成本 231 万美元,且内部测试重复率仅从 13.45% 降至 3.83%。
推荐理由:原文给出完整的归因实验和修复路径,还公开了成本对比,读者可借鉴其诊断 RL 训练中涌现行为的方法。
凡人小北@frxiaobeiAI 评分5454HuggingFace 上开源了一个用 Claude Opus 5.5 生成的模拟医患对话数据集,覆盖 2194 种疾病,平均每段 33 轮,从症状、检查聊到治疗和后续安排。
HuggingFace Daily Papers(社区热门论文)AI 评分3636 AlignOPSD:面向长程智能体的决策对齐在线策略蒸馏
针对长程智能体在线策略自蒸馏中的"决策—时间戳错配"问题,研究者提出 AlignOPSD,通过决策对齐监督校正与半马尔可夫分层信用分配,将监督对齐后再分配信用。
HuggingFace Daily Papers(社区热门论文)AI 评分4242 CompoWorld:面向通用智能体的组合式环境扩展框架
CompoWorld 通过组合可复用服务来扩展智能体任务空间,构建了 448 个服务、暴露 10,130 个工具,并用 3K SFT 轨迹和 1K RL 任务训练 Qwen3.6-35B-A3B。实验显示其在八个基准上平均提升 9.17 分,在 AutomationBench 上超过 Claude Opus 4.6 等前沿模型,并领先所有对比的 35B-A3B 专用智能体模型。
HuggingFace Daily Papers(社区热门论文)AI 评分4141 Pruned CTC:面向大词表 ASR 训练的内存高效方案
Pruned CTC 将 CTC 对齐计算限制在目标 token 与 blank 构成的小子集内,同时保留全词表归一化,并证明其损失与梯度同全词表 CTC 完全等价。
HuggingFace Daily Papers(社区热门论文)AI 评分3939 SMAT:简单高效的合并感知训练方法
研究者提出 SMAT(Simple MAT),通过将常见模型合并操作归纳为 Scale、Mask、Perturb 三种,联合优化专家损失与模拟合并参数下的期望损失,并引入周期性调度、算子融合和参数存储切换,使每步仅需一次前向和一次反向传播。在四个语言与视觉语言骨干模型上,SMAT 将五种合并方法的平均分较各骨干最强基线提升 1.07-2.16 分,训练时间开销较标准微调不足 2%。
HuggingFace Daily Papers(社区热门论文)AI 评分4242 DISCO:用接地-推理解耦实现分布式长上下文扩展
针对长上下文推理质量随输入增长而崩塌的"context rot"问题,研究者提出 DISCO,借鉴 Apache Spark 的分布式思路,将长上下文切分给多个 Worker LLM 并行做局部接地,由经 GRPO 强化学习训练的 Driver LLM 负责规划与汇总。
HuggingFace Daily Papers(社区热门论文)AI 评分4747 让 LLM 学会从上下文学习:基于扰动公开文档的合成训练方法
研究者构建了一套无需人工标注的合成流水线,通过扰动改写公开文档、生成需依赖文档推理的问题与评分标准,从 3.5k 篇文档生成约 10k 样本,用于训练学生模型。
HuggingFace Daily Papers(社区热门论文)AI 评分4040 QwenGyre:面向超长程智能体训练的弹性强化学习框架
阿里发布 QwenGyre,一个面向超长程(xlong-horizon)智能体在线强化学习的端到端框架,可在不中断执行的情况下弹性重分配 GPU,并通过轨迹处理器去重冗余分支路径。
Hacker News 热门(buzzing.cc 中文翻译)AI 评分7070 DeepSeek 发布 DSec 弹性计算沙箱平台技术报告,支撑大规模智能体 RL 训练
DeepSeek-AI 发布技术报告,介绍用于大规模 LLM 智能体 RL 训练与评估的生产级沙箱平台 DeepSeek Elastic Compute(DSec),统一提供 FnCall、容器、microVM 和完整 VM 四种后端。
Rohan Paul@rohanpaul_aiAI 评分6161新泽西州环保部门对与微软关联的 AI 数据中心 DataOne 处以 107 万美元罚款,原因是 62 台未经许可的天然气发电机,该机构称这是新泽西州对数据中心规模最大的一次执法行动。
IT之家(RSS)AI 评分6464 牛津博德利图书馆藏书被曝用于 OpenAI 模型训练,校方称已告知教职员工
据卫报援引《信息自由法》调取的内部文件,OpenAI 数字化的牛津大学博德利图书馆藏书已被用于构建 OpenAI 训练集,而 2025 年 3 月的合作公告未提及此用途。截至 2025 年 6 月已提供 12.5 万份历史学位论文扫描影印页及 1 万首 16 世纪宽边民谣珍藏集;教职员工曾担忧声誉与环保风险,校方回应称资料均已超出版权保护期、授权非排他,并将陆续公开这批数字化文献。
MarkTechPost(RSS)AI 评分5757 用 AugLy 构建图像、文本、音频多模态数据增强与对抗鲁棒性基准教程
本教程基于 AugLy 构建覆盖图像、文本、音频的端到端多模态数据增强与鲁棒性工作流。教程解决依赖兼容问题,生成确定性合成数据集,演示 AugLy 的函数式与类式 API。
Rohan Paul@rohanpaul_aiAI 评分6060Columbia Business School 报告《Financing the AI Buildout》测算 2025 至 2032 年美国新增 182.7 GW 数据中心容量的收入要求。
Rohan Paul@rohanpaul_aiAI 评分7272HuggingFace Daily Papers(社区热门论文)AI 评分4242 DepthBench:衡量残差连接如何提升 Transformer 计算深度
研究者推出 DepthBench,一个在固定模型规模与预训练配方下系统改变宽深比(d_model/n_layer)的受控基准,用于衡量架构深度能否转化为有效计算深度。
HuggingFace Daily Papers(社区热门论文)AI 评分4444 LT-OPD:用在线策略自蒸馏实现极端视觉 token 压缩
针对多模态大模型在极低视觉 token 预算下性能骤降的问题,研究者提出训练框架 LT-OPD,让仅保留少量视觉 token 的学生模型在自己生成的轨迹上接受冻结全 token 教师模型的分布监督,并引入逐步降低 token 预算的课程。
Replit ⠕@ReplitAI 评分5656
MarkTechPost(RSS)AI 评分5555 Perplexity 用提示词引导自蒸馏让 Computer 智能体从真实错误中学习
Perplexity Research 发布后训练研究,将拒绝采样微调与提示引导自蒸馏(OPSD)结合,用 GLM 5.2 驱动的 Perplexity Computer 真实用户会话(含失败会话)训练模型。
HuggingFace Daily Papers(社区热门论文)AI 评分5252 Rufus-Air:基于 GLM-4.5-Air-Base 的开源 LLM 后训练配方
Rufus-Air 发布了在 GLM-4.5-Air-Base(106B-A12B)上可复现的开源后训练配方,按 SFT、Reasoning RL、Coding RL、Instruction-Following RL、通用 Agent、Coding Agent、Search Agent 和 RLHF 八个阶段串行组织。
TechCrunch:AI(RSS)AI 评分5252 Lightspeed 为新一期印度基金募集 2.5 亿美元,专注早期 AI 投资
Lightspeed 正为新一期印度基金 Lightspeed India Partners V 募集 2.5 亿美元,据致投资人信已获 80% 认购承诺,规模仅为 2022 年上一期 5 亿美元基金的一半。
Hacker News 热门(buzzing.cc 中文翻译)AI 评分6464 Google Project Suncatcher 将发射搭载 TPU 的原型卫星测试太空 AI 算力
Google Project Suncatcher 计划通过 SpaceX Transporter-18 拼车任务发射首颗原型卫星,测试 TPU 在太空的运行表现。Trillium TPU 在 UC Davis 质子束测试中可承受超过五年太空任务总电离剂量的辐射;团队正用热管加辐射板方案解决真空散热,并计划 2027 年发射两颗卫星测试高带宽激光互联。
HuggingFace Daily Papers(社区热门论文)AI 评分4545 ZooWork-ShopRanker:面向电商场景的偏好对齐重排序模型发布
ZooWork团队发布ShopRanker系列电商重排序模型(0.6B/4B/8B),通过多LLM裁判生成偏好标签进行训练,并推出包含约1万条真实流量数据的ShopRank-Bench基准。实验显示该系列模型在电商检索任务上显著优于现有开源基线及未对齐版本,且小参数模型表现突出。目前模型与基准已开源。
HuggingFace Daily Papers(社区热门论文)AI 评分3838 MOPD-Router:多教师在线蒸馏中的令牌级路由新框架
针对多教师在线蒸馏(MOPD)中依赖提示词级领域标签进行硬路由的局限,研究者提出 MOPD-Router 框架。该框架无需领域标签或独立路由模型,即可在每个令牌级别对全教师池的监督信号进行路由。其中提出的 ExpertAlign 指标通过评估教师纠正是否体现其专业化能力来加权信号。实验显示,ExpertAlign 在无标签和有标签数据的四种设置下均取得最佳性能,相比均值聚合提升显著,证明了令牌级路由能有效利用跨域互补监督。
Rohan Paul@rohanpaul_aiAI 评分6565MarkTechPost(RSS)AI 评分5858 BottleCap AI 发布 ThinkingCap-Qwen3.8-27B:思考 token 减少 37.2%,精度仅降 0.86pp
BottleCap AI 发布 ThinkingCap-Qwen3.8-27B,这是基于 Qwen3.8-27B 的微调模型,在 12 个基准上平均减少 37.2% 思考 token,宏观精度从 86.65% 降至 85.79%。