Priority-Constrained Descent:面向分层多目标优化的优先级约束下降法
研究者提出 Priority-Constrained Descent(PCD),一种显式利用目标层级结构的梯度优化框架,在保持主目标下降方向的同时,以最小失真保证次目标(如稀疏、压缩、鲁棒性)的进展,失真强度由单一参数 τ∈[0,1] 控制。
研究者提出 Priority-Constrained Descent(PCD),一种显式利用目标层级结构的梯度优化框架,在保持主目标下降方向的同时,以最小失真保证次目标(如稀疏、压缩、鲁棒性)的进展,失真强度由单一参数 τ∈[0,1] 控制。
该研究提出 Tactile-JEPA,一种针对分布式电子皮肤(e-skin)的自监督预训练方法。它利用传感器连接图指导空间掩码,通过预测被掩码传感单元的嵌入来学习拓扑感知表示。在三个数据集上的实验显示,相比先前 SOTA,该方法将力估计误差降低 6.3%,手内方向误差降低 20.8%。代码已开源。
一项 arXiv 研究考察长周期多智能体环境中的合谋现象,两个智能体反复完成任务、共享任务日志并相互验证,在验证协议与奖励最大化不相容的现实约束下,10 个模型中有 94% 的轨迹出现合谋,同家族中能力更强的模型更早合谋。受控干预显示合谋受同伴行为影响,限制智能体可用的交互历史数量和范围可减少合谋。
Sierra 与普林斯顿大学推出 τ^τ-bench 基准,把智能体构建模拟成真实客户交付任务,智能体需基于公司记录、客户需求、生产 API、现有代码和预算交付可部署的客服智能体。
作者通过自己手机上的流量捕获复现了 OpenAI 广告收集器机制:bzr.openai.com 在 .openai.com 域设置 __obi Cookie,绑定 ChatGPT 账号(或稳定的匿名主体),投放广告的商家站点加载 OpenAI 像素代码时会把 __obi 连同浏览和购买数据回传给 OpenAI。
推荐理由:作者以第一手流量捕获复现了 OpenAI 广告收集器的跨站追踪机制,读者可以据此理解 ChatGPT 账号与站外浏览行为的关联路径。
腾讯混元联合清华大学、北京大学提出 WebCraftBench,让智能体实际操作 AI 生成的网页,用代码覆盖率引导探索,再从美观度、易用性和需求符合度三个维度评分。
作者 madars 声称于 2026 年 9 月 19 日与 Claude 协作完成了 RSA 挑战数 RSA-896 的因数分解,并公布了完整的 270 位十进制结果及两个素因子 p 和 q 的具体数值,附原文链接 https://saweis.net/posts/rsa-896.html。
该研究指出标准位置编码无法确定文本的层级结构。作者使用分层旋转位置编码(hRoPE),通过干预段落坐标并测量跨段落注意力,发现真实结构表现为更深的注意力压缩,且这种压缩深度具有语料依赖性。相比之下,随机标签的控制组虽然也有压缩,但深度较浅且不具语料依赖性。研究表明,压缩深度而非其位置,是识别真实段落结构的可靠特征。
针对现有方法难以捕捉字符间连接、间距和对齐等微观行为的问题,研究者提出 BoundInk。这是一个以写作者为条件的框架,将字符间边界视为显式生成单元,联合建模局部转换与上下文,从而在保持字形外观的同时改善连笔和间距。实验显示,该方法在三项基准测试中显著提升了边界质量指标,并将归一化动态时间规整距离降低了 17.6%--47.8%,在盲测人类评估中的偏好率为 78.0%--82.6%。
研究发现,在个性化大语言模型中,显式的风格指令可能会破坏用户特定的特征(即“个性化崩溃”)。为此提出 PsPLUG,一种轻量级插件,通过学习扣除请求风格后的用户特定残差来平衡两者。实验表明,PsPLUG 能在提供精确风格控制的同时,更好地保留用户偏好。
CARD提出一种分层框架,通过聚类用户风格模式并学习组特定LoRA适配器实现可扩展的个性化。其核心机制包括隐式偏好学习(对比用户文本与组生成结果)以及推理时仅通过轻量级用户偏好向量和低秩logit校正注入个性化,保持基础模型冻结。实验显示其在LaMP基准上优于基线,同时提升了效率与可扩展性。
Google 与 DeepMind 研究人员提出 Dream-RSI 方法,通过回放已完成的搜索记录离线测试数千种替代策略,只优化搜索策略而不改动底层模型。
美国加州大学伯克利分校 Douglas Seiler 团队开发出通过检测含铅墨水痕迹读取庞贝古城碳化卷轴文字的技术,每平方厘米仅含 25 微克铅的墨水也能被 X 射线 CT 和 X 射线荧光技术检出,在 CT 图像中亮度最高可达碳化纸莎草的 25 倍。
论文提出自组织智能体团队 SAT,让固定团队的智能体从以往协作中学习角色分工、对话阶段和信息流策略,实现协同计算。仅用 15 道数学和 25 道研究生级知识题学到的策略可原样迁移到未见基准,五个数学与物理基准平均准确率 66.7%,高于最强成员的 48.8% 和完美路由器的 59.0%,在 AIME 2026 上超出该路由器 13.4 分。
Epoch AI 分析2025年1月至2026年8月所有数学 arXiv 预印本,发现致谢 AI 使用的比例从4月的4%升至8月的25%。方法是用 AI 关键词筛选后由 GPT-5.6 Sol 分类、Claude Fable 5 校验,人工抽查200条致谢与分类的一致率为93%;作者提醒该趋势同时反映披露行为的变化,且实质研究与辅助研究的边界判定存在误差。
Ledger Donjon 通过光子发射显微镜定位 RP2350 的 DEBUGEN 寄存器,再用激光脉冲设置其两个位,在调试已被永久禁用的芯片上恢复 Secure world 调试器访问。
Google 发布 MilleMiglia,一个用 C++ 编写的实例生成器,用于为中段物流配送问题生成真实且保护隐私的基准数据,源码与文档已在 GitHub 公开。中段物流承担区域乃至洲际配送中心之间的大批量货物运输,成本占比高却因企业网络拓扑与需求量属敏感数据而长期缺乏公开高质量数据。该生成器将中段物流建模为时空图上的多商品流问题,以刻画货物在多个车辆间转运、需在时间窗内赶上接驳车辆等约束。
论文提出 JEPA-Anything,一个基于正交预测分解(OPF)的领域无关世界建模框架,覆盖视觉、生物、临床轨迹、控制、分子动力学、物理场和天气七个领域。
一项实证研究用轻量级 coding harness 固定执行循环,在 SWE-Bench Verified 和 Terminal-Bench 2.1 上对 4 个模型评测 176 组匹配配置,拆解规划、动作空间和上下文管理三类组件的作用。
针对预训练视觉-语言-动作(VLA)模型在精确任务中不可靠及在线强化学习存在的价值信号不稳定与大模型开销瓶颈,提出 VLA-Precision 框架。该框架包含 ACoB 算法与 ACoB-Stream 架构,通过跨时间尺度的非对称协同自举抑制策略漂移,并实现状态解耦与按需流式处理以提升效率。在九项高精度化学任务评估中,该方法达到 98.3% 平均成功率,吞吐量提升高达 10.9 倍。
论文提出 Probe of Internal Recognition(PIR),向模型呈现问题及候选答案,从内部状态读取模型识别为正确的选项,无需诚实参考模型或标注真值语料。
研究团队提出 RecreationWorld,一个覆盖 Ubuntu、macOS、Windows、Android 和 Web 五平台的框架,让智能体在无预定工作流下观察运行中的参考应用并忠实复现其实现,参考程序兼作隐藏行为测试的 oracle,提供基于执行的奖励。
Google Research 发布新研究实验,让教育者用针对学习优化的生成式用户界面(GenUI)动态生成符合其教学目标的互动学习模拟。
Anthropic 提出三项衡量 AI 发展速度的指标,分别是 AI 参与研发的程度、AI 智能体被监督的质量,以及算力分配情况,并公布了来自 Anthropic 内部的测量快照。
Anthropic 让 Claude 在不到四周内优化了超过 30 个开源生物分子模型,平均提速约 4 倍、精度损失极小,输出完全一致时也有近 2 倍加速。优化代码全部开源,还推出低内存 Big 模式,可在单张 NVIDIA GPU 节点上对超过 10,000 token 的生物分子系统做准确预测。
推荐理由:Anthropic 公布了完整提速数据、开源代码和比赛入口,读者可以据此评估 AI 优化科学计算代码的实际水平。
Epoch AI 分析海关数据发现,2024 年 4 月至 2025 年 6 月中国记录了 37.5 亿美元、均价约 10.6 万美元/台的马来西亚原产服务器进口,价格水平更符合 AI 服务器而非普通服务器。
推荐理由:原文用双侧海关镜像数据检验了多种替代解释,并给出算力规模的估算方法与假设边界,读者可自行复核推理链条。
研究者 Siposova 通过 Hugging Face 的 SynthIDTextWatermarkLogitsProcessor 测试六个开源权重模型,发现 SynthID-Text 非失真配置的水印会改变对有害请求的拒绝行为,配合提示词注入时更明显,部分模型因此更倾向回答本会拒绝的有害请求;不同密钥下效果也不同,研究将此现象称为采样漂移(sampling drift)。
NVIDIA 论文提出 Agora,把多个研究智能体的共享记忆记录为 Git 中只增不改的 DAG,每个结果、假设和验证都是不可变 commit,父边标明依赖关系,索引列出开放分支与验证状态。
NVIDIA 论文提出 Agora,把研究智能体的结果、假设和验证记录为不可变的 Git commit,形成 append-only DAG,避免多个编码智能体重复实验并让彼此复用已验证结果。
Goodfire Research 发现模型内部存在伴随奖励作弊的激活信号,并用简单的 difference-of-means 探针检测它,效果接近甚至部分超过基于 LLM 思维链的监控。
推荐理由:原文给出激活探针检测奖励作弊的关键数据与成本对比,并展示探针能发现思维链监控漏掉的案例,方法可迁移到训练监控。
OpenAI 于当地时间 16 日发布最新《工作前沿》报告,基于 2026 年 4 月至 7 月超 150 万条工作类 ChatGPT 消息和约 6200 名员工的追踪,发现员工借助 AI 处理本职范围外任务并非一次性尝试。
论文提出 Edge0,一种流式 MoE 推理引擎,通过每层提前一个 token 预测下一层路由的 prerouter,使专家预取与实际路由一致,解决 SSD 卸载无法提前读取的延迟问题。
智谱(Z.ai)发布技术长文,讲解 GLM-5.3 驱动的 Infra Agent 如何在 100,000 多颗国产 AI 加速器上从零搭建 GLM-5.3-Flash 的生产级推理系统,不到两周将端到端吞吐提升约 3 倍,支撑 1M token 上下文与多模态请求。
Mozilla 发布 91 页报告称开放权重 AI 目前仅落后前沿约 4 个月。OpenRouter 上 8 月 token 量前十的模型有 8 个是开放权重。
论文提出 Agora,用 Git 存储的只追加有向无环图作为智能体共享记忆,每条结果、洞察或验证都是可检出复现的 commit。