Databricks 讲解如何通过专用 GPU kernel 生成实现极致推理效率
Databricks 发文介绍如何通过专用 GPU kernel 生成实现极高效率。文章指出传统生产推理系统依赖通用 kernel 处理多样化负载,并探讨专用 kernel 的优化路径。
Databricks 发文介绍如何通过专用 GPU kernel 生成实现极高效率。文章指出传统生产推理系统依赖通用 kernel 处理多样化负载,并探讨专用 kernel 的优化路径。
蚂蚁百灵发布 Ling-3.0-flash-Sante,一个基于 Ling-3.0-flash 构建、面向健康与医疗领域增强的 MoE 模型,名字取自法语 santé(健康)。
Anthropic 宣布 Claude 上月完成了 Fermat 大定理的首个形式化证明,这是迄今最大的 Lean 证明。
推荐理由:原文给出证明规模、验证范围和完整代码入口,读者可以据此了解 AI 形式化数学论证的实际能力边界。
Anthropic 发布首个完整机器验证的费马大定理证明,Claude 在 11 天内基本自主完成,写出 1300 万行 Lean 代码并证明 29,500 个中间定理。
推荐理由:原文给出了耗时、代码量、平台与验证方式等细节,读者可以了解多智能体自动形式化复杂数学证明的实现路径。
a16z 的 Raghu Raghuram 撰文宣布投资 Gimlet Labs,称其为首个多芯片(multi-silicon)推理云,目标是在同等电力下产出更多智能。
据 Bloomberg 报道,DeepSeek 计划在内蒙古吉瓦级数据中心部署 16 万颗华为 950DT 芯片,建成后将是已知最大规模的华为 AI 集群之一。
DRACO 提出在结果信号缺失的长程智能体训练中,动态生成评分标准并按轨迹打分,再把判断以闭式方法重分配到相关步骤,在 GRPO 中产生差异化逐步优势,不引入任何训练的归因模块。
GPT-6 Astra 的基准结论相互矛盾:Epoch AI 以 169 分将其排在 267 个模型之首,Artificial Analysis 给出 61 分,仅与前代 Sol 持平、落后 Claude Fable 5.1 的 66 分。
推荐理由:原文汇总多家基准分歧数据并梳理 ARC-AGI-3 效率细节,读者可以借此理解 GPT-6 Astra 各项成绩的真实含义。
作者凡人小北发帖称,Qwen 3.8-Flash 的能力可以把名称中的 Flash 改成 Pro。正文仅此一句观点,未提供更多细节或依据。
日报汇总 9 月 4 日多条动态:OpenAI 正式发布 GPT-6 Astra,称在 computer use、编码、科学和网络攻防上达到 SOTA,98% FrontierMath Tier 4。
Monolith砺思资本转载的一篇短文,标题为「BrainGPT前夜?」,正文仅一句「当AI开始直接理解大脑」,未给出具体模型、数据或细节。
论文提出 compile by training,把自然语言规格编译为可复用的神经函数:编译时由教师模型生成任务样例,训练紧凑解释器的小型 adapter,运行时无需教师模型,可像普通软件一样存储、版本化和组合。
The Information 报道称 OpenAI 的 Astra 采用 recurrent depth / looped transformer 架构并可能掩盖部分推理过程,引发热议。
论文提出 LatentStream,将流式视频记忆从 store-and-retrieve 转向 retrieve-and-internalize,用潜在工作记忆内化历史证据以支持严格因果与有限内存下的推理。框架包含分层流式记忆、分层潜在记忆演化和置信度引导的潜在记忆优化三个组件,并在现有在线与离线视频基准上取得新的 SOTA 结果。
OpenAI发布GPT-6 Astar,暂未上线,价格涨到与claude fable5持平且缓存读取更贵,但所有用户可将100%额度用于gpt6,同等任务token消耗约为opus5的1/5。
Ethan Mollick 让 Astra 用能找到的在线数据集做原创创业研究并预注册假设。结果 Astra 产出了大量格式精美、技术正确的论文,但选题乏味,他认为其缺乏研究品味。
作者yurivish在LessWrong发帖,讨论我们应该对Astra的复用(recurrent)架构抱有多大程度的担心。该帖子登上Hacker News热门,获得100 points。
研究探讨 on-policy distillation(OPD)中训练数据的作用,发现仅用 1 条 query 训练即可持续提升数百步并恢复全量数据 OPD 的大部分增益。
Salesforce AI Research 提出 Random Attention,不对缓存 token 打分,而是保留提示词并在每个注意力头内均匀随机驱逐,在四个模型、六个推理任务上匹配最强先验驱逐方法,vLLM 部署下吞吐量高出 32-43%。
WorldReward 是一个基于 VLM 的成对偏好奖励模型,为相机条件世界模型统一评估动作一致性与视觉质量。方法将视频分解为动作对齐的块并投票聚合,配套发布人工标注的 WorldReward-Bench,在三个维度上分别超过 GPT-5.5 约 3.42、1.45 和 3.56 个百分点,用于 HY-WorldPlay 1.5 的 RL 后训练可同时提升动作执行与视觉质量。
蚂蚁集团正式开源面向真实金融工作流的 Ling-3.0-flash-Fin(124B A5.1B),为 MoE 架构、支持最长约 256K 上下文,并同步开放面向金融搜索 Agent 的评测基准 FinFIRST(Financial Information Retrieval, Sourcing and Traceability),中金公司投行团队在构建过程中提供专业支持。
作者让 Claude Fable 5 在 Claude Code 中分三步移植其 1993 年 Amiga 游戏:34,000 行 C++ 一个晚上迁入 Godot 4,72,758 行无注释 68000 汇编先用 vasm 重建出与发售版字节一致的二进制再移植,并把 1993 原作作为第二启动项嵌入新游戏。
推荐理由:作者亲历者复盘用 LLM 移植 68000 汇编的完整过程,给出可验证的字节级校验方法和多处 AI 出错的实例。
Cerebras 公共端点模型目录新增 Qwen 3.8 27B(qwen-3.8-27b,27 billion 参数,上下文 64k/128k,速度约 1500 tokens/s),另有 gpt-oss-120b(120 billion 参数,65k/131k 上下文,约 3000 tokens/s)。
Microsoft 与加州大学圣地亚哥分校的论文指出,模型在 SFT 后可能看起来更好,但因 SFT 会抹掉 RL 需要发现的罕见正确行为,反而是更差的 RL 起点。
论文记录了两套同源系统中共 750 万次单模型调用、约 30 万次链上操作的自主交易智能体生产环境测量,覆盖 21 天 Base memecoin 市场(DX Terminal Pro,3,505 个用户金库)和 Hyperliquid 永续合约(DXAP,500 至 599 个智能体)。
Gary Marcus 发文点评 GPT-6 Astra,称多项报告显示其为真正的进步,OpenAI 产品显式创建并操纵符号世界模型,令其近十年的主张获得印证。
推荐理由:作者结合自身近十年主张神经符号世界模型的立场,指出 Astra 的关键未知在鲁棒性与可监控性,判断有具体依据。
OpenAI 于 9 月 3 日发布新一代大语言模型 GPT-6 Astra,是其首个达到准备框架中关键级网络安全能力门槛的模型,可在无逐步指导下发现防护严密系统的未知漏洞。