Debias-SparseGPT:面向大语言模型的偏见感知剪枝方法
论文提出 Debias-SparseGPT,一种后训练剪枝方法,利用人口统计对比输入上的二阶项进行表征去偏。在 25%、50% 和 2:4 结构化稀疏度下,该方法相比 SparseGPT 持续降低剪枝引入的偏见,同时保持模型困惑度和零样本准确率;在限制最严格的 2:4 结构化稀疏模式下,用长上下文、内容丰富的示例扩充校准集可进一步提升下游性能和公平性。
论文提出 Debias-SparseGPT,一种后训练剪枝方法,利用人口统计对比输入上的二阶项进行表征去偏。在 25%、50% 和 2:4 结构化稀疏度下,该方法相比 SparseGPT 持续降低剪枝引入的偏见,同时保持模型困惑度和零样本准确率;在限制最严格的 2:4 结构化稀疏模式下,用长上下文、内容丰富的示例扩充校准集可进一步提升下游性能和公平性。
Hugging Face 发布完整教程,使用 TRL 库以 GRPO 微调 LiquidAI/LFM2.5-350M,约 500 样本、100 训练步即可在免费级 Colab 或 Kaggle GPU 上完成,训练后模型在 IFStruct 基准上从 22.6% 提升至 29.7%。
Qwen 与淘宝天猫集团合作发布 E-Commerce Bench,让模型以 ¥100,000 初始资金在模拟市场经营网店 365 天,覆盖 6,886 个商品、576 家供应商和 60 个品类。
Hugging Face 博客作者基于 Surya Narreddi 的原始想法,用 TRL、OpenEnv 和 Qwen/Qwen3.5-35B-A3B 复现了让语言模型通过 p5.brush 写 JavaScript 画水彩的 RL 训练流程,所有数据集、环境、脚本和模型均开源在 Hub。
推荐理由:作者用 TRL 和 OpenEnv 完整开源复现了让编码模型画水彩的 RL 配方,含数据池、环境和三组奖励对比,可整体迁移复用。
据第一财经报道,字节跳动正推进 296 亿美元(约合 1,993.99 亿元人民币)银团贷款,若完成将成为 2026 年亚洲规模第二大的美元计价银团贷款,仅次于软银 3 月的 400 亿美元过桥融资。
美团智播官方发布技术长文,介绍AI数字人直播的完整技术闭环,涵盖高保真形象生成与编辑(SDIP、SREdit)、文本驱动动作生成(MoTiGA)、语音手势协调生成(StreamingTalk)和视觉token压缩推理加速(Glance2Gaze)。
百度智能云具身智能前沿讲堂上,清华大学AIR助理教授赵昊与百度智能云AI计算首席科学家王雁鹏等对谈世界模型规模化问题。赵昊提出以3D/4D Token为核心的世界模型路线,认为世界模型不等于视频生成,需表达空间结构、光学属性和速度、加速度等动态信息;其OmniNWM通过动作编码与相机参数解耦,实现200帧稳定生成,并与精锋医疗、极智嘉分别合作手术预演和仓库机器人场景。
论文提出 Repo-To-Skill 与技能驱动的智能体 DisCo,将 GitHub 仓库中的操作性知识蒸馏为可复用技能,分为任务无关和任务导向两种形式。任务无关蒸馏产出 AREX-Skill Library,从 1,000 个常用 ML 仓库蒸馏出 5,000+ 个经核验的技能,按 20 个领域、178 个能力族组织。
SolarWM 是一个全开源的交互式视频世界模型基础,包含可重构多源数据引擎和骨干原生适配框架,将10个数据集约143万片段(约25.85TB)转为统一的帧对齐训练契约,并基于 Wan2.2、LTX-2.5 和 MiniMax-H3 训练四个 5B–33B 模型。
论文提出 Cliff,一种奖励塑形策略,用现成 LLM 作为教师识别每次 rollout 中的第一个错误,将 rollout 分解为正确前缀和错误后缀,分别赋予正负 token 级优势。实验覆盖 12 个场景,Cliff 比.on-policy distillation 高 15%,比标准 GRPO 高 7%,即使教师能力一般也有效。
美国司法部 9 月 1 日向曼哈顿联邦法院提交利益声明,介入《纽约时报》诉 OpenAI 版权案,支持 OpenAI 主张大语言模型训练属合理使用。DOJ 以国家安全和 AI 产业竞争力为主要论据,称训练使用具有转换性;《纽约时报》发言人批评政府站在 AI 公司一边牺牲创作者权益。法官要求双方最迟 9 月 4 日提交简易判决动议,该案结果可能为 AI 训练版权合法性确立先例。
推荐理由:司法部罕见公开站在 OpenAI 一边,这条报道梳理了双方核心论点和案件时间线,有助于理解 AI 训练版权争议的走向。
研究提出 Net Utility,一种无需数据的指标,通过 SVD 分解每个任务的 LoRA,按任务效用及与其他任务方向的干扰为各奇异方向打分,再在总方向数约束下全局择优,实现跨任务的预算感知秩分配。该方法可叠加在五种合并方法、三种合并空间之上,在视觉与语言两组任务上均优于不做秩分配的方案,视觉任务平均提升 +2.1%,语言任务平均提升 +2.2%。
研究发现前向 KL 蒸馏在 pre-training 阶段同时提升推理与事实记忆,但在 mid-training 阶段会拖慢事实记忆习得,同时推理仍持续提升。作者提出 Switch Distillation,以教师预测熵作为路由信号,仅在教师置信的 token 上蒸馏,其余回退到交叉熵。
博通公布 2026 财年第三财季财报,营收 295.91 亿美元同比增长 86%,GAAP 归母净利润 130.88 亿美元同比增长 216%,AI 半导体收入 167 亿美元同比增长 221%。公司预计第四季度营收 348 亿美元、AI 半导体收入 217 亿美元同比增长 236%,并宣布每股 0.65 美元季度分红。
X Square Robot 发布 TwinDEX,一对协同设计的三指九自由度灵巧操作接口,一个可穿戴用于数据采集,一个用于机器人部署,两者共享相同的运动学、接触面、外观和传感器。
Databricks 宣布扩展 Genie Agents 能力,新增深度分析、文件推理等功能。此前公司在 Data and AI Summit 上宣布 Genie Spaces 演进为 Genie Agents。
Pangram CEO Max Spero 做客 TechCrunch Equity 播客,谈 AI 生成内容检测的问题。话题涵盖 Substack 新闻通讯、在线欺诈,以及人类写作的未来。
Cohere Labs 聚合七个公开目录,构建含 696,291 个工具、123,069 个 MCP 服务器的 Agentic Task Ecosystem 数据集并对外开放。
推荐理由:研究用近 70 万个 MCP 工具构建供给侧数据集,给出自动化落在职业哪个环节的证据,可与曝光度研究互补阅读。
Mistral 帮助中心文档说明:除企业版默认退出外,Vibe、移动端和 Mistral Studio 及 API 的用户输入输出数据默认可能用于模型训练,用户可随时选择退出。文中给出各平台的退出步骤,并提醒 Vibe 与 API 的退出开关相互独立,需分别设置;Vibe 中上传的文档也被视为输入数据。
九合创投宣布鼎犀智创完成 Pre-A 轮融资,成为九合系新成员。公司方向是以自进化 Physical AI 加速高性能材料研发,构建可复用的 AI 材料研发基础设施,原文未提供更多技术或业务细节。
据 DigiTimes 9 月 2 日报道,美光正在研究高耐久性 NAND 闪存模块,计划部署在距离 GPU 更近的位置,当前被称为“近 GPU NAND”。该方案可让 GPU 直接访问数百 GB 的 NAND 存储池,放置在 GPU 封装内部或 PCB,工作方式类似 HBM、GDDR7;与传统 TLC 或 QLC NAND 相比密度更低,重点提升 I/O 速度和带宽。
具身机器人企业自变量 9 月 2 日发布孪生三指九自由度灵巧操作手 TwinDEX,其中一只可穿戴用于数据采集,另一只装在机器人上用于真机部署。官方评测显示其数据采集效率达真机遥操作的 5.3 倍,训练模型时无本体数据近乎可 100% 替代真机遥操作数据。
一篇 arXiv 论文提出在数据驻留约束下,将超过 200 个内部应用的流量整合到单个自托管模型,通过生产错误分析沿指令遵循、函数调用和内部任务分布三个轴弥补质量差距。
论文提出 AgentFold,将折叠模型开发建模为对可执行代码变体的闭环智能体树搜索。智能体从紧凑的 ESMFold 衍生模型出发,提出架构修改、实现调试、运行训练,并记录成败经验决定分支算力分配。
论文提出 SMELT(Sparse MoE Transformer,中段层循环两次)配方,在逐 token FLOPs、非嵌入参数量和 KV cache 三项预算均匹配的条件下研究循环 Transformer。
论文提出 DiagEvo,从求解器自身失败历史中提取反复出现的错误原因,存入分层错误原因记忆,并以此生成针对性问题,无需外部任务资源。其挑战者用记忆状态与复发次数平衡定向生成与自由探索,双重置信度过滤只保留中间难度问题。
论文提出 StudentSim,通过池化训练加按学生专门化,把稀疏的学生个人数据转化为能模拟学生应答并在辅导下更新的个性化学生模拟器。配套发布 StudentSimEval 评测协议,覆盖国际象棋、英语二语写作和数学 3 个领域的 60 名学生,衡量行为保真度 F 和指导响应度 R。
论文提出 RoboTok,一个互联网规模数据引擎,输入人类操作视频即可从网络视频中检索与操作相关的人类示范,用于训练灵巧机器人策略。方法基于估计的演员中心参考系中的 3D 手部轨迹学习潜在运动空间,使操作行为的比较不受相机视角、场景外观和演员遮挡影响,并支持互联网规模视频的高效搜索与持续索引。在检索基准和下游策略评估中,RoboTok 检索出更相关的示范并提升了下游任务成功率。
该研究将随机梯度流(SGF)建模为渗流过程,认为架构对称性迫使子网络以离散的同步块合并,并在宏观序参量上表现为方差尖峰,类似物理相变。研究还指出这种捕获机制及标度级联在显式重尾噪声模型下同样适用于 Adam 和 AdamW。论文链接:https://arxiv.org/abs/2609.02373
AI 训练数据创业公司 AfterQuery 传闻完成一轮融资,估值达 32 亿美元,距其 4 月以 3 亿美元估值完成 3000 万美元 A 轮仅五个月。Y Combinator 合伙人 Gustaf Alströmer 称这是该加速器史上从创立到独角兽最快的公司,两位创始人为 22 和 23 岁,来自 Y Combinator 2025 年冬季批次。
FDA 在 Databricks for Government 上构建安全、AI 就绪的数据基础,原文将联邦数据平台现代化比作在航行中重建航母引擎,正文仅给出这一背景性描述。
普林斯顿大学、蚂蚁集团和斯坦福大学的研究团队提出 AQuA,一套由两个互不共享智能体、记忆和状态的语言模型量化研究系统,其设计要点是在迭代开始前冻结数据划分、特征与标签定义和评估器,让智能体只能在受约束的 DSL 内探索,以阻断自我改进中的数据泄漏。
Databricks 发布博客,讲解如何在数据栈中落地 Genie Ontology,为 AI 智能体构建超越语义模型的共享业务上下文。
据《The Information》援引知情人士报道,马斯克在最近数周内重组 SpaceXAI 数据中心建设团队并替换多名高管,调整与田纳西州和密西西比州数据中心的工程和稳定性问题有关。