SemiAnalysis 解析 GLM5.3 稀疏注意力对 HBM 内存与推理成本的影响
SemiAnalysis 分析 GLM5.3 的 DeepSeek Sparse Attention 如何影响 HBM 内存使用,指出 top-k 选择仍需完整上下文驻留 HBM,稀疏注意力并不直接降低内存容量瓶颈。
SemiAnalysis 分析 GLM5.3 的 DeepSeek Sparse Attention 如何影响 HBM 内存使用,指出 top-k 选择仍需完整上下文驻留 HBM,稀疏注意力并不直接降低内存容量瓶颈。
Artificial Analysis 发布对 Claude Sonnet 5.5 的评测:其智能指数得分 56,max effort 下比 Sonnet 5 高 18 分,升至第 2 名,仅落后 Opus 5.5 (max)。
推荐理由:Artificial Analysis 实测指出 Sonnet 5.5 逼近 Opus 5.5 依赖约 193k 输出 token,成本细节对选型有直接参考价值。
Anthropic 发布 Claude Sonnet 5.5,输出速度提升超过 30%,因每任务消耗 token 更少,有效成本最多降低 30%,多项基准接近 Opus 5.5。
Fireworks AI 推出 Ember-1,这是基于 Moonshot AI 开源权重 Kimi K3 进行后训练的专用模型。该模型通过优化内部推理过程,在保持任务准确率的同时将生成的推理 Token 减少了约 40%。与单纯降低推理努力程度不同,Ember-1 保留了有用的自我反思并削减了冗余循环。基准测试显示,其在 Terminal Bench 2.1 和 DeepSWE 1.1 上表现优于 K3 Max,且在生产环境 A/B 测试中实现了显著的成本节约。目前仅通过 Fireworks Serverless API 以研究预览形式提供,未开放权重。
Reasonable 团队撰文介绍 TLA+ 是什么,回应 Boris Cherny 用 Opus 5.5 将 Claude Agent SDK 部分建模为 TLA+ 和 Lean 的热传推文。
Privatemode 团队展示了一种无需微调的方法,通过编号选项、预填 choice_index: 前缀并读取选项索引的 log 概率,让 GLM-5.3-Flash 在单次前向中输出带概率的类型化决策。
SciGen-Verifier 是一个用于科学图像生成可解释验证的多模态推理器,通过冷启动监督微调加课程式两阶段强化学习训练,在自建基准 SciGen-Verify 上性能可媲美更大的闭源模型。该基准覆盖指令遵循、多学科推理与世界知识,采用二值判断、解释与纠错编辑指令的三层协议。它还可作为在线 critic 用于图像的迭代修正。
针对 RLVR 中细粒度信用分配依赖辅助模型或额外采样的问题,研究者提出熵引导信用分配方法 EAPO,将归一化策略熵与响应优势符号耦合,对成功响应中的高熵决策加强强化、对失败响应中的低熵决策加强惩罚,同时衰减不确定位置的惩罚以保留恢复机会。
针对长上下文推理质量随输入增长而崩塌的"context rot"问题,研究者提出 DISCO,借鉴 Apache Spark 的分布式思路,将长上下文切分给多个 Worker LLM 并行做局部接地,由经 GRPO 强化学习训练的 Driver LLM 负责规划与汇总。
研究者构建了一套无需人工标注的合成流水线,通过扰动改写公开文档、生成需依赖文档推理的问题与评分标准,从 3.5k 篇文档生成约 10k 样本,用于训练学生模型。
SpatialSpeak 是一个两阶段框架,将 QA 原生重建预训练与空间 CoT 学习结合,在 ReVSI 上把 CoT-VC 带来的增益从 2.6 分提升到 6.9 分。该框架在 ReVSI、VSI-Bench 和 SPAR-Bench 上取得 SOTA,ReVSI 得分 62.8,超过最强对比基线 8.7 分。
推荐理由:原文给出具体排名、分数差和混合价格,读者可据此比较 Claude Opus 5.5 与前代的性价比位置。
Anthropic 宣布 Claude 在 Claude Science 系统中仅凭一条提示词、无人监督连续运行数天,算出平面 N=4 超杨-米尔斯理论六粒子振幅的九圈结果,超越 Lance Dixon 团队 2023 年的八圈纪录,总成本几千美元,其中直接自举路线的 Python 运行成本仅约 100 美元。
The Verge Decoder 播客专访 Cloudflare CEO Matthew Prince,谈 AI 如何改变互联网商业模式。
数学家 Amit Sahai 在 Terence Tao 博客发文,认为 AI 已在产生超越人类即时理解的新数学思想,人类群体将普遍面临跟不上 AI 的体验。他主张以集体投入和扩充数学研究者规模来理解 AI 突破,并以 AI 提出全新核聚变电站设计的设想说明独立人类专家在重大决策中理解模型与安全依据的必要性。
FlashForward 直接复用当前 chunk 去噪前向中已算出的 in-flight KV cache,省去为更新缓存而做的额外前向,并生成稀疏的干净锚点 latent 以稳定生成轨迹。
研究揭示 LLM 强化学习(RLVR)中训练引擎与推理引擎对同一 token 赋予不同概率的问题,并提出校准重要性采样(CIS)进行校正。CIS 基于 logit 位移刻画,采用置信度感知截断:大正位移在单一常数阈值处截断,映射为随 token 置信度升高而收紧的重要性比率上限。在三个 MoE 模型和五个数学推理基准上,CIS 均取得最高五基准平均分。
研究者提出用结合代数中的稀疏交互表替代 Transformer 投影层的普通矩阵乘法,在物理块大小固定时实现矩阵维度上的二次算术复杂度,并给出适配 GPU 执行的形状约束。
研究者提出结构化注意力架构 CoWA,将因果历史访问分散到各 KV head:所有 head 共享近对角与 prefix-sink 窗口,互补的长程窗口划分其余历史,其并集实现完整因果覆盖,且无需学习型 router 或 indexer。
研究者提出融合注意力原语 MALA,按归一化贡献分配 post-score 计算,在 8K 匹配工作量下平均遗漏质量仅 0.0188%,接近逐实例参考质量 oracle 的 0.0182%。
WaveFront Decoding(WFD)是一种面向循环语言模型的无训练自推测解码框架,利用中间循环输出作为草稿预测、并借助权重共享批量处理不同位置与循环深度的 token 状态。
物理学家 Matt von Hippel 发起的挑战达成:Anthropic 的 Liam Fitzpatrick 与 Siddharth Mishra-Sharma 用 Claude Science(harness)让 Claude 直接算出 planar N=4 super Yang-Mills 六粒子振幅九圈结果。
推荐理由:作者以其曾判定过难的本领域前沿计算为参照,评估了 Claude Science 的实际能力与可推广性,提供了来自领域专家的一手判断。
arXiv 论文(https://arxiv.org/abs/2609.30233)研究 coding agent 能否自动合成可跨实例泛化的程序来解决广义任务与运动规划(TAMP)问题。
Rufus-Air 发布了在 GLM-4.5-Air-Base(106B-A12B)上可复现的开源后训练配方,按 SFT、Reasoning RL、Coding RL、Instruction-Following RL、通用 Agent、Coding Agent、Search Agent 和 RLHF 八个阶段串行组织。
论文介绍 PUBG Ally,一个在 PUBG: BATTLEGROUNDS 中作为语音队友的具身智能体,可感知动态游戏环境并自主行动。语言模型智能体通过受控接口检查游戏信息、理解玩家语音并下发高层动作,交给更快的控制层执行移动、战斗和恢复;团队基于近 39k 场真实玩家共玩对局的数据做迭代训练,并通过模型压缩、上下文压缩、安全训练和运行时护栏实现低延迟端侧部署与玩家沟通安全。
科学史研究者 benbreen 分享用 GPT-6 Sol、GPT-6 Astra 和 Opus 5.5 解决历史学开放问题的早期结果,包括用 GPT-6 Astra 识别出 Isaac Newton 从法文炼金术文本翻译成拉丁文的一段出处。
研究提出 ARGUS,一种结构化语言模型流水线,用于审计气候政策差分法(DID)研究中的识别假设证据。ARGUS 依据十一维假设-含义-证据准则进行评估,并在无法检索相关证据时选择弃权。在注入缺陷的基准测试中,ARGUS 检测到 73% 的植入缺陷,显著高于关键词基线的 18%。在经济学论文评估中,约 40% 的维度因缺乏可检索证据而弃权。该工具旨在为专家审查提供风险定位报告,而非直接裁定因果主张。代码与数据已开源。
针对循环语言模型(Looped LMs)中不同 token 循环次数不同导致无法使用标准批处理系统的问题,研究者提出了“连续深度批处理”(CDB)方法。该方法通过在循环步骤间动态构建新批次、管理 KV 缓存及预测退出时机,实现了高效的深度自适应推理。实验表明,全循环架构最适合此方法,CDB 可实现高达 99% 的预估最大加速比。
Stanford 与 Together AI 的论文提出 Self-Organizing Agent Teams(SAT),让固定智能体团队从过往协作中学习可复用的角色分工与流程,而非辩论后投票。
BottleCap AI 发布 ThinkingCap-Qwen3.8-27B,这是基于 Qwen3.8-27B 的微调模型,在 12 个基准上平均减少 37.2% 思考 token,宏观精度从 86.65% 降至 85.79%。
Epoch AI 估算,在固定基准分数上取得同等性能的市场价格平均每季度下降约 47%,约合每年 13 倍。OpenAI 的 o3 在 2025 年初以每题约 30 美分在 GPQA Diamond 达到 75% 准确率,18 个月后 GPT-5.6 系列模型以原价 1/725 达到同样分数。