微软研究院用机器学习预测电网空间天气风险,覆盖美国 66,935 座变电站
微软研究院开发了一套端到端机器学习流水线,利用 L1 拉格朗日点的太阳风观测数据,为美国本土 66,935 座变电站生成 30-60 分钟前的空间天气风险预测。系统结合 AE 与 Dst 指数预测、地质电导率和电网数据,在 2020-2026 年评估期内检测到近 80% 的重大空间天气事件,其中 Dst 预测器在 62.2% 的高活跃时段优于 Burton 方程。
微软研究院开发了一套端到端机器学习流水线,利用 L1 拉格朗日点的太阳风观测数据,为美国本土 66,935 座变电站生成 30-60 分钟前的空间天气风险预测。系统结合 AE 与 Dst 指数预测、地质电导率和电网数据,在 2020-2026 年评估期内检测到近 80% 的重大空间天气事件,其中 Dst 预测器在 62.2% 的高活跃时段优于 Burton 方程。
PReCache 是一个免训练的 KV cache 共享框架,通过 PreLRShared 和 ReBaseShared 两种设计共享基于预训练权重计算的基础 cache,并预计算紧凑的智能体专属低秩(LR)cache。
DeepSeek-AI 发布技术报告,介绍用于大规模 LLM 智能体 RL 训练与评估的生产级沙箱平台 DeepSeek Elastic Compute(DSec),统一提供 FnCall、容器、microVM 和完整 VM 四种后端。
Nvidia 研究人员提出 SoL-Pi 系统,用研究 agent 自动优化编码 agent 的控制层(harness),在 EdgeBench 上相比 Codex 节省 50%、相比 Claude Code 节省 54.3% 的 token,性能与原 Pi harness 大致持平。
WaveFront Decoding(WFD)是一种面向循环语言模型的无训练自推测解码框架,利用中间循环输出作为草稿预测、并借助权重共享批量处理不同位置与循环深度的 token 状态。
论文提出 G^2PTQ,一个在全局监督、逐块优化目标下同时整合一阶与二阶信息的统一 PTQ 框架,通过在量化每个 Transformer 块前刷新梯度与 Hessian 估计,避免以往全局方法的估计过时问题。
研究者提出 softmax 重参数化,一种在量化前选取功能等价输出头的后训练方法,通过从每个输出行减去词汇行均值的标量倍数,并按验证 KL 分别为 RTN、激活加权 MSE 和 full-Hessian GPTQ 选择系数。
针对循环语言模型(Looped LMs)中不同 token 循环次数不同导致无法使用标准批处理系统的问题,研究者提出了“连续深度批处理”(CDB)方法。该方法通过在循环步骤间动态构建新批次、管理 KV 缓存及预测退出时机,实现了高效的深度自适应推理。实验表明,全循环架构最适合此方法,CDB 可实现高达 99% 的预估最大加速比。
微软研究院发布关于物理AI机器人推理基础设施的研究。通过系统评估移动操作任务,发现将推理从机载GPU卸载至边缘或云端,能解决机载算力限制模型规模、导致响应延迟(最高383%)及精度下降的问题。实验显示,卸载推理不仅提升了任务成功率,还通过替换高功耗机载GPU为轻量硬件(如树莓派),使机器人电池寿命延长高达160%。此外,微软推出了基于Kubernetes的Physical AI Toolchain工具集,支持自动化容器化与分布式推理部署。
DeepSeek 发布 DSec(DeepSeek Elastic Compute)论文并署名梁文锋,公开用于 Agent 训练的沙盒基础设施技术细节。
研究提出"分离式量化"(DQ),针对 prefill 与 decode 两个阶段分别定制计算格式、权重与存储位置。
智谱(Z.ai)发布技术长文,讲解 GLM-5.3 驱动的 Infra Agent 如何在 100,000 多颗国产 AI 加速器上从零搭建 GLM-5.3-Flash 的生产级推理系统,不到两周将端到端吞吐提升约 3 倍,支撑 1M token 上下文与多模态请求。
论文提出 BITCOS,一种由存在位图加压缩符号向量组成的三值 LLM 权重布局,按零密度 z 计成本为 2−z bits per weight。作者实测 29 个三值模型发现零权重占比最高达 51.5%,其中 26 个模型的存储比 five-trit packing 更紧凑,最稀疏模型达 1.485 bits per weight。
RayOrch提出了一种编程模型和分布式执行引擎,用于解决基础模型训练数据准备中异构文档和视频转换的扩展性问题。它通过保留父子关系、支持有序变量基数扩展及匹配收集,优化GPU批处理效率。在NVIDIA H20 GPU上,RayOrch将MinerU从4卡扩至64卡时加速15.14倍,视频流水线从8卡扩至64卡时加速7.82倍,端到端时间较Ray Data减少13.1%。代码已开源。
IBM Research 团队在 ALTK-Evolve 中推出 Consistency Analyzer 和一致性指南,针对智能体反复执行同一任务时结果不稳定的问题。
一项名为 Detokenization Leaks 的研究提出新攻击,通过观察本地部署 LLM 去分词时的 CPU 缓存活动重建生成文本,无需读取模型内存。
Miles v0.1 是一个全栈、生产就绪的前沿后训练系统,围绕 slime 的设计,将 RL 训练循环各环节按可验证、干净、可定制的原则构建,并已在 https://github.com/radixark/miles 开源。
Epoch AI 推出 AI Chip Users explorer,以 Nvidia H100 等效值(H100e)估算 OpenAI、Google DeepMind、Anthropic、Meta Superintelligence Labs 和 SpaceXAI 用于研究、训练和推理的算力。
Epoch AI 测量四款模型的首 token 延迟(TTFT)随上下文长度的缩放,发现 GPT-5.6 Terra 和 Sol 呈明显二次曲线,Claude Sonnet 5 接近线性,Opus 5 噪声较大但仍接近线性。
推荐理由:原文以实测数据和三种稳健估计器比较 GPT-5.6 与 Claude 5 的长上下文延迟缩放,可帮助读者理解两家不同的架构取舍与成本影响。
Salesforce AI Research 提出 Random Attention,不对缓存 token 打分,而是保留提示词并在每个注意力头内均匀随机驱逐,在四个模型、六个推理任务上匹配最强先验驱逐方法,vLLM 部署下吞吐量高出 32-43%。
Minima 对 Qwen3.8-27B(48 层 GDN、16 层注意力)的全部 496 个线性层(含 GDN)应用 NVFP4 W4A4 量化,在 MMLU-Pro。
Epoch AI 基于 Frontier Data Centers 数据集(308 条里程碑、86 座设施)估算,自 2024 年年中以来最大在运数据中心的 IT 功率以每年 2.3 倍增长,90% 置信区间对应约 10 个月翻倍。
KAIST AI 与 Google DeepMind 等发布论文《Language Models Can Control Their Own Attention》。
论文提出 Declarative Attention(DA)协议,让模型在链式思考中声明需要关注哪些上下文区域,推理引擎据此解析声明并跳过大部分 KV cache 读取,避免每步 O(N) 的外部打分开销。
一篇 arXiv 论文提出在数据驻留约束下,将超过 200 个内部应用的流量整合到单个自托管模型,通过生产错误分析沿指令遵循、函数调用和内部任务分布三个轴弥补质量差距。
arXiv 论文提出 CRISP,一种输入自适应的稀疏预填充方法,用结构代理 C_struct 替代 JSD 路由,省去 pooled matmul 与 KL 散度开销,并针对 post-softmax 质量悬崖设计基于噪声底线的 sink-aware 阈值。
Berkeley AI Research 与 IBM Research 将进化式内核搜索框架 K-Search 扩展到 MLX 后端,通过结构化的 CUDA 到 MLX 翻译层,把已有 CUDA 内核作为知识库迁移到 Apple Silicon。
推荐理由:K-Search 把 CUDA 内核优化经验迁移到 Apple Silicon,给出注意力与 Mamba 两个内核的具体加速数据。
Google DeepMind 发布论文提出 Decoupled DiLoCo 分布式训练架构,把大规模训练拆分为解耦的计算岛并异步传输数据,从而隔离局部硬件故障。
推荐理由:原文给出跨数据中心异步训练在带宽、故障隔离和混合硬件上的实测结果,可据此判断分布式预训练的工程取舍。