超越教师分配:领域归一化多教师同策略蒸馏(DN-MOPD)
针对多教师同策略蒸馏(MOPD)中指令跟随反馈的离散度是数学反馈的数倍、从而主导学生更新的问题,研究者提出领域归一化 MOPD(DN-MOPD),按各领域实测离散度重新缩放反馈。
针对多教师同策略蒸馏(MOPD)中指令跟随反馈的离散度是数学反馈的数倍、从而主导学生更新的问题,研究者提出领域归一化 MOPD(DN-MOPD),按各领域实测离散度重新缩放反馈。
RenderRank 是一种从压缩视觉文档表示中学习查询相关性打分的重排序器,不再依赖传统文本 token 序列。在 BEIR 的 11 个数据集上,它减少 16.5-35.5% 输入 token,平均 NDCG@10 达 55.96,超过所有参数量低于 4B 的文本基线及部分更大模型。
针对现有图像编辑模型在递归编辑中快速退化的问题,研究者提出 MT-OPSD 在线策略自蒸馏框架,让模型在自生成的条件下状态上训练,并由干净条件教师模型提供编辑监督,无需多轮标注。该工作同时发布 LME-Bench,包含 100 组十轮编辑会话,用于评估长程鲁棒性。在三个编辑骨干上的实验显示,MT-OPSD 显著提升长程编辑成功率、减少多轮崩溃,并基本保持单轮编辑质量。
UMM-Reflection 通过交错强化学习,让统一多模态模型在一条轨迹内完成"诊断—修改—再观察"的完整反思循环,轨迹级优势同时更新反思 token 与基于流的图像修改,推理时无需外部验证器。
GeoVerse 通过在预训练 3D 基础模型的几何隐空间中生成、并注入视频生成模型的外观先验,实现世界一致的新视角合成。它从 Wan2.2 VACE 提取多层级特征,经 ControlNet 式适配器注入几何隐扩散模型,并用全局空间记忆聚合已观测与合成内容以保持跨视角连贯。
InfiniHand 是一个端到端流式前馈框架,可直接从未标定的第一视角视频中联合估计 MANO 参数、相机轨迹和手部位置,无需级联独立的手部姿态估计器与 SLAM 系统。在域内基准上,其 ARCTIC PA-p 相比 ViDiHand 降低 21.4%,并显著缓解世界坐标系漂移,运行速度达 11.19 FPS,吞吐量超过 HaWoR 两倍。
一项匹配评估对比了表征工程与行为安全防护在 LLM 安全控制与监控上的表现。安全控制方面,DPO 整体控制最强且随训练数据增加而提升,但后续良性微调会削弱其安全性;表征引导仅在低数据场景(尤其高质量对比数据)保持竞争力。安全监控方面,专用文本监控器检测准确率最高,表征探针则以更低边际成本保持竞争力,监控引导干预还能在几乎不增加过度拒答的情况下恢复 DPO 因良性微调损失的大部分安全性。
研究对比了无编码器与有编码器多模态大模型的缩放定律,发现去掉视觉编码器会把多模态目标的算力最优分配推向更大模型,文本目标则几乎不变。两者在文本目标上损失-算力前沿几乎重合,但多模态目标上无编码器模型小规模时落后,预计约 10^22 FLOPs 时追平。无编码器时语言模型通过视觉专属适配接管其角色:视觉 token 双向交互随算力增长愈发有益,视觉处理前移,视觉 token 的专家路由更集中。
ColNanoVDR 是首个将无文档查询蒸馏用于多向量视觉文档检索(VDR)的框架,通过基于熵最优传输的 OTW 目标对齐学生与教师的查询 token,无需页面数据。
研究者提出 Imprint Reader,用 Semantic Mount-and-Read Tuning(SaRT)训练模型以自然语言描述冻结的权重更新,在留出更新上知识类 Pass@100 为 2%、行为类为 16%。
研究者从强化学习视角重新审视 on-policy distillation(OPD),提出 Least-Square Policy Distillation(LSPD)框架,将价值型 RL 中的乐观探索与 off-policy 数据复用引入策略蒸馏。
吉利智充 C12 于 9 月 29 日在杭州、上海、宁波、嘉兴、西安五城同步落地,单枪峰值功率 2250 千瓦,10% 至 97% 补能平均用时 8 分 40 秒。
中国科学院 9 月 29 日在北京发布“科学前沿极限突破计划”及首批 10 个项目,聚焦新元素合成、暗物质暗能量本质、化学键微观测量、人工合成细胞等“四极”领域前沿问题。计划以重大科技基础设施开放联用和人工智能赋能科学研究为抓手,并试点与极限突破性研究相适应的评价方式,减少预设目标和过程干预,不唯论文产出和短期成果。
OpenAI 发布安全文档框架提案,主张前沿强化学习训练在开跑前应准备结构化的安全案例。文中给出三类初步准则,包括对齐训练与遏制监控等技术保障、异议与审批等运营流程,以及错位事故的调查与公开披露做法,并表示这些实践正在 OpenAI 内部实施且欢迎社区反馈。
开发者用 Processing 生成黄金角螺旋点阵并做 Voronoi 剖分,再用 CadQuery 建模、3D 打印出 89 颗可寻址 RGB LED 的叶序造型灯盘。灯盘由 STM32 blackpill 驱动,通过 SPI 控制 neopixel,并接入 INMP441 I2S 数字麦克风,借助 ARM CMSIS 库做傅里叶变换与多频段能量分析,实现随房间声音变化的音频响应效果。
H Company 发布 Holo4 系列通用计算机使用模型,包含 Holo4 27B(dense)和 Holo4 35B-A3B(MoE,3B 激活)两个规格,支持 256K 上下文,可在桌面、网页、Android、代码沙箱和业务 API 上以同一方式调用。
韩国芯片设计服务企业 SEMIFIVE 将为一家美国无晶圆厂 AI 芯片企业开发支持 LPDDR6、PCIe Gen5 的数据中心级推理加速器,这是 LPDDR6 成为 ASIC 片外缓存选择的早期案例之一。该芯片预计 2027H1 流片、2028 年量产出货,订单采用“规格交接”模式,总价约 703 亿韩元,为 SEMIFIVE 史上最大单笔合同,也是其北美首个同类型项目。
2026 年世界互联网大会乌镇峰会将于 11 月 2 日至 5 日在浙江乌镇举行,主题为“开源开放共建共享 —— 携手构建网络空间命运共同体”。本届峰会设置 27 个分论坛,主论坛设“人工智能乌镇对话”环节,邀请全球领军科技企业、知名开源大模型企业负责人及人工智能科学家围绕全球人工智能开源生态构建展开交流。“互联网之光”博览会已邀请 400 余家企业参展。
千问与夸克网盘深度打通,用户可让千问读取网盘资料并重新整理。有博士把 6TB 文献梳理成个人知识库和可视化知识地图,有用户从几千张照片中筛出精华生成全球旅行地图和明信片 PDF,还有人用三步学习法在 48 小时内啃完一门新学科。整理好的资料可一键上传夸克网盘并生成分享链接,用于团队协作。
OpenAI 发布针对前沿 AI 强化学习训练的安全指导原则(参考 Towards safety cases for frontier AI training),要求训练前提交结构化安全论证,并由研究负责人、安全负责人、首席科学家等多名高级管理人员审查,每人有权否决训练任务。
微软 9 月 8 日推送的 Windows 10 更新 KB5126256 与第三方工具 4t Tray Minimizer 不兼容,导致文件资源管理器频繁崩溃。
Kubb 为一名客户定制了纯金无风扇迷你主机 Kubb Fanless,采用 24K 金打造,重约 13 公斤,售价约 170 万美元。纯金外壳的导热能力比铝高出 30%-50%,该机型可选配英特尔酷睿 Ultra 5 225H、酷睿 Ultra 5 358H 或 AMD 锐龙 AI 5 340 处理器,内存最高 128GB DDR5,标配 1TB M.2 NVMe 固态硬盘。
科技部部长阴和俊在国新办“开局起步‘十五五’”发布会上介绍,2025 年全社会研发投入超过 3.92 万亿元,占 GDP 比重达 2.8%,首次超过 OECD 成员国平均水平。PCT 国际专利申请量和高水平国际期刊论文数量连续多年保持世界第一,开源大模型领跑全球。《国家创新指数报告 2025》显示我国国家创新能力综合排名位居全球第 9 位。
OpenAI 首席产品官 Tibo 宣布明天向新用户重新开放月费 200 美元的 ChatGPT Pro 订阅,并调整用量计算方式,等效 API 价值相比旧方案约减半支出。新方案不恢复 5 小时使用限制,仅保留周额度管理;此前因 GPT-6 Astra 算力需求激增,OpenAI 曾于 9 月 11 日暂停新用户注册。OpenAI 还预告明天将为 Pro 订阅新增更多不计量功能,具体内容暂未公布。
集邦咨询(TrendForce)9 月 28 日发布报告称,AI 智能体浪潮下全球服务器 CPU 交付周期已拉长至 25~30 周,常规情况下为 16~20 周。
中国气象局 9 月 29 日发布《气象数据管理办法》,将于 11 月 1 日起正式实施。该办法建立公共气象数据授权运营机制,为公共气象数据确权、授权运营提供明确法规依据,填补制度空白。同时鼓励各类主体开展气象数据开发利用技术、高质量数据集研究建设,并明确数据出境与安全评估等安全保障制度。
MiniCPM-o 4.5 现已支持 SGLang Omni v0.1.7。 为开发者提供更多灵活运行和构建该模型的方式。
浙江乐清警方破获一起利用 AI 语音系统实施网贷诈骗的案件,两个月内致上千人受骗,30 名嫌疑人被抓,涉案流水超千万元,冻结资金 100 余万元。团伙用 AI 机器人批量外呼引流,单日呼出可超 20 万次,按 A 至 F 六级筛选意向用户后转人工话务员行骗,并利用正规平台会员退费规则的知识盲区骗取信任。
微软在巴塞罗那 European Microsoft Fabric + SQL Community Conference 上发布 Fabric 与 Azure Databases 多项更新。
麦肯锡 9 月 29 日报告称,到 2035 年约 1100 万美国劳动者或因 AI 替代岗位而需转行,占现有劳动力约 7%,年度转行人数或从 21.5 万增至三倍。最可能转行的是办公室和行政支持、零售和销售、运输和物流岗位,低收入者需转行的可能性接近高收入者的 8 倍,报告估计最终人数在 600 万至 1600 万之间。
我们如何看待保障前沿 RL 训练运行的安全:https://openai.com/index/towards-safety-cases-for-frontier-ai-training/
中国互联网络信息中心在 2026 中国互联网基础资源大会上发布《生成式人工智能应用发展报告(2026)》,截至 2026 年上半年我国生成式人工智能用户规模超 7 亿人,普及率突破 50%。