不改参数改乘积:面向 Transformer 的结合代数层
研究者提出用结合代数中的稀疏交互表替代 Transformer 投影层的普通矩阵乘法,在物理块大小固定时实现矩阵维度上的二次算术复杂度,并给出适配 GPU 执行的形状约束。
研究者提出用结合代数中的稀疏交互表替代 Transformer 投影层的普通矩阵乘法,在物理块大小固定时实现矩阵维度上的二次算术复杂度,并给出适配 GPU 执行的形状约束。
研究者推出 DepthBench,一个在固定模型规模与预训练配方下系统改变宽深比(d_model/n_layer)的受控基准,用于衡量架构深度能否转化为有效计算深度。
研究者提出结构化注意力架构 CoWA,将因果历史访问分散到各 KV head:所有 head 共享近对角与 prefix-sink 窗口,互补的长程窗口划分其余历史,其并集实现完整因果覆盖,且无需学习型 router 或 indexer。
SkillDRE 是一个全自动框架,通过执行前扫描与运行时防御反馈的双阶段闭环,演化完整的恶意 Agent 技能包。在 SkillsBench 上对四个受害模型评测,平均攻击成功率达 45.28%,超过最强基线 40.3%,且最终提交的技能未触发任何 SkillScan 告警,并基本保留良性任务性能。结果表明,两阶段防御反馈可作为自适应红队的有效学习信号,单独评估任一防御阶段都会遗漏攻击能力。
研究者提出融合注意力原语 MALA,按归一化贡献分配 post-score 计算,在 8K 匹配工作量下平均遗漏质量仅 0.0188%,接近逐实例参考质量 oracle 的 0.0182%。
针对 LLM 智能体在长序列依赖任务中决策漂移的问题,研究者提出 Adaptive Consistency Graph(ACG),将执行证据及其来源增量组织进持久图,并在有限上下文预算下为每次决策构建以需求为中心的临时视图。
GAGAR 是一个面向代码智能体强化学习的质量感知信用重分配框架,通过 SFT 训练的智能体评分器在同一工作区内联合检查并排序通过测试的轨迹,对低排名轨迹降权并按比例重缩放优势值以保持总和不变。
研究提出残差可迁移性(RT)指标,量化神经图像水印证据在跨图像迁移后的可解码程度,发现架构设计而非训练侧变化是 RT 差异的主因,并识别出两种强化水印证据对载体图像依赖的机制。针对难以重新设计架构的现有水印系统,作者提出即插即用策略 CoverLock,在高 RT 水印系统上实现了优于传统手工防御和基于学习分类器防御的安全—鲁棒性权衡。
针对 DeepSeekMoE、OLMoE 和 Qwen3-MoE 的研究发现,MoE 模型合并后大部分专家重分配源于输入偏移而非同层参数变化,源路由差异难以预测恢复源路由带来的下一 token 似然增益。
WaveFront Decoding(WFD)是一种面向循环语言模型的无训练自推测解码框架,利用中间循环输出作为草稿预测、并借助权重共享批量处理不同位置与循环深度的 token 状态。
针对多模态大模型在极低视觉 token 预算下性能骤降的问题,研究者提出训练框架 LT-OPD,让仅保留少量视觉 token 的学生模型在自己生成的轨迹上接受冻结全 token 教师模型的分布监督,并引入逐步降低 token 预算的课程。
Stanford 研究者将在 10 月旧金山 COLM 会议上发表两项研究,用测量科学与心理测量学检验 56 个常用基准,发现基准并不总是测量其声称的能力,声称测同一属性的基准之间也常互相矛盾。研究以 BBQ 偏见基准为例指出其更像在测阅读理解,另一项研究拆解了安全分数在非英语语言中下降的原因,区分模型 guardrails 变弱与翻译后测试本身失真这两种因素。
Arena 宣布 OpenAI 的 GPT-6 Sol (Max) 进入 Agent Arena,基于 4K+ 真实智能体会话取得 +7.7% 净改进,排名第 6,中位成本 $0.75/task。
推荐理由:榜单方基于四千多场真实智能体会话给出成本与得分对比,读者可据此权衡 GPT-6 Sol (Max) 在性价比上的位置。
慕尼黑 CESifo 的 Robert Fairlie 和 Jane Wu 发布工作论文,称没有证据显示应届大学毕业生在绝对或相对水平上出现明显的岗位替代或招聘减少。
Perplexity Research 发布后训练研究,将拒绝采样微调与提示引导自蒸馏(OPSD)结合,用 GLM 5.2 驱动的 Perplexity Computer 真实用户会话(含失败会话)训练模型。
arXiv 论文(https://arxiv.org/abs/2609.30233)研究 coding agent 能否自动合成可跨实例泛化的程序来解决广义任务与运动规划(TAMP)问题。
Rufus-Air 发布了在 GLM-4.5-Air-Base(106B-A12B)上可复现的开源后训练配方,按 SFT、Reasoning RL、Coding RL、Instruction-Following RL、通用 Agent、Coding Agent、Search Agent 和 RLHF 八个阶段串行组织。
论文介绍 PUBG Ally,一个在 PUBG: BATTLEGROUNDS 中作为语音队友的具身智能体,可感知动态游戏环境并自主行动。语言模型智能体通过受控接口检查游戏信息、理解玩家语音并下发高层动作,交给更快的控制层执行移动、战斗和恢复;团队基于近 39k 场真实玩家共玩对局的数据做迭代训练,并通过模型压缩、上下文压缩、安全训练和运行时护栏实现低延迟端侧部署与玩家沟通安全。
该研究提出一种改进的 Stable Diffusion 3 架构,通过同时以摄影测量 DSM 和 Pléiades 卫星图像作为条件,对垂直配准的数字表面模型进行细化。实验表明,这种多模态条件方法能显著提升高程精度,在法国城市测试中,密集城区的 RMSE 从 6.00 米降至 3.45 米(上下文城市)及 2.76 米(留出城市)。
论文提出 TRACE 基准,旨在解决现有流式视频理解评估中忽略证据时效性、历史维护及响应触发机制的问题。该框架通过统一因果协议控制信息可用性,并多维报告答案质量、及时性、负载等指标。在 1240 条记录上的实验显示,相似的 QA 准确率可能掩盖系统在完成度、生成负载及主动响应行为(如误报、漏报)上的巨大差异,强调应将性能视为执行条件下的系统行为而非单一分数。
ZooWork团队发布ShopRanker系列电商重排序模型(0.6B/4B/8B),通过多LLM裁判生成偏好标签进行训练,并推出包含约1万条真实流量数据的ShopRank-Bench基准。实验显示该系列模型在电商检索任务上显著优于现有开源基线及未对齐版本,且小参数模型表现突出。目前模型与基准已开源。
论文提出 G^2PTQ,一个在全局监督、逐块优化目标下同时整合一阶与二阶信息的统一 PTQ 框架,通过在量化每个 Transformer 块前刷新梯度与 Hessian 估计,避免以往全局方法的估计过时问题。
针对多教师在线蒸馏(MOPD)中依赖提示词级领域标签进行硬路由的局限,研究者提出 MOPD-Router 框架。该框架无需领域标签或独立路由模型,即可在每个令牌级别对全教师池的监督信号进行路由。其中提出的 ExpertAlign 指标通过评估教师纠正是否体现其专业化能力来加权信号。实验显示,ExpertAlign 在无标签和有标签数据的四种设置下均取得最佳性能,相比均值聚合提升显著,证明了令牌级路由能有效利用跨域互补监督。
研究者提出 softmax 重参数化,一种在量化前选取功能等价输出头的后训练方法,通过从每个输出行减去词汇行均值的标量倍数,并按验证 KL 分别为 RTN、激活加权 MSE 和 full-Hessian GPTQ 选择系数。
Duplex-MPE 基准发布,用于评估全双工语音助手在多人共享对话中何时应答、保持沉默或停止说话,包含 2000 个由三到四名人类说话者与一名助手构成的场景,同一请求分显式与隐式指代配对。
研究提出 ARGUS,一种结构化语言模型流水线,用于审计气候政策差分法(DID)研究中的识别假设证据。ARGUS 依据十一维假设-含义-证据准则进行评估,并在无法检索相关证据时选择弃权。在注入缺陷的基准测试中,ARGUS 检测到 73% 的植入缺陷,显著高于关键词基线的 18%。在经济学论文评估中,约 40% 的维度因缺乏可检索证据而弃权。该工具旨在为专家审查提供风险定位报告,而非直接裁定因果主张。代码与数据已开源。
针对循环语言模型(Looped LMs)中不同 token 循环次数不同导致无法使用标准批处理系统的问题,研究者提出了“连续深度批处理”(CDB)方法。该方法通过在循环步骤间动态构建新批次、管理 KV 缓存及预测退出时机,实现了高效的深度自适应推理。实验表明,全循环架构最适合此方法,CDB 可实现高达 99% 的预估最大加速比。
MIT McGovern Institute 研究团队开发了基于自杀风险词表的语言处理工具,可从危机求助文本中预测自杀风险,成果发表于 Journal of Psychopathology and Clinical Science。
Stanford 与 Together AI 的论文提出 Self-Organizing Agent Teams(SAT),让固定智能体团队从过往协作中学习可复用的角色分工与流程,而非辩论后投票。
Anthropic 开展 Project Swap 实验,让 201 名员工携带一本书,其 Claude 智能体在数字交易大厅代表他们谈判换书。5 分钟聊天后,Claude 构建的图书排序与本人自评排序在 61% 的书对上一致;市场效率为 0.55(最优 0.89),其中 85% 的差距来自智能体对参与者偏好的理解不足,而非谈判表现。
推荐理由:实验设计能区分智能体理解偏好与谈判能力各自的贡献,结果显示短板主要在代表性而非谈判,模型强弱的影响大于指令。
Forecasting Research Institute 的中期报告显示,专家和超级预测员系统性低估了 AI 进展。AI 在 2025 年 7 月达到 IMO 金牌水平,比专家预测中位数提前五年;病毒学基准、网络安全基准和 Anthropic 约 1000 亿美元年化收入等指标也远超预测,如专家对 2026 年底 AI 公司最高 ARR 的中位数预测仅 200 亿美元。