#推理
#推理
今日 2 条
DAIR.AI@dair_aiAI 评分5555NVIDIA Blog(RSS)AI 评分5151 NVIDIA Vera Rubin NVL72 首次亮相 MLPerf Inference v6.1,吞吐最高达 GB300 NVL72 的 3.7 倍
NVIDIA Vera Rubin NVL72 首次提交 MLPerf Inference v6.1 preview 结果,Qwen3-VL 上吞吐最高达 GB300 NVL72 的 3.7 倍,DeepSeek-R1 上最高 2.5 倍。
Artificial Analysis 完整文章(网页)AI 评分5858 Artificial Analysis 评测蚂蚁集团金融模型 Ling-3.0-flash-Fin
蚂蚁集团发布基于 Ling-3.0-flash 的金融开源权重模型 Ling-3.0-flash-Fin,在 Artificial Analysis Intelligence Index 得 23 分,Finance & Accounting Index 得 24 分。
Hacker News 热门(buzzing.cc 中文翻译)AI 评分5454 强化学习让 LLM 强者愈强,Never Give Up 方法帮助模型攻克难题
Michael Noukhovitch 发表论文,提出 LLM 强化学习训练中的马太效应,即 RL 提升幅度与模型初始能力成正比,最难的问题(初始 pass@32 为 0)几乎不改进。
Rohan Paul@rohanpaul_aiAI 评分5656IT之家(RSS)AI 评分6969 DeepSeek 刘胜与发文《我不得不把才华埋葬在昨天》引热议,回应称不代表公司立场
DeepSeek v4.1 主 Attention 算子负责人刘胜与 9 月 14 日发文《我不得不把才华埋葬在昨天》,文章获微信公众号 10 万+ 阅读并登上知乎热榜第一。
Hacker News 热门(buzzing.cc 中文翻译)AI 评分5959 为什么在纳维-斯托克斯方程之后,我仍然对大型语言模型持看空态度
作者认为前沿实验室按'即将实现知识工作全自动化'的叙事定价,但当前模型在训练任务的小邻域之外容易彻底失败或奖励作弊,纳维-斯托克斯这类纯数学成果依赖定理即严格规约、Lean 验证器经多年审计的最佳条件,无法推广到大多数知识工作。
MarkTechPost(RSS)AI 评分7777 Google 发布 Gemini 3.8 Live 与 3.8 Live Extended Thinking 语音智能体模型
Google 发布 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking 两款原生语音到语音对话模型,已在 Gemini Live API 和 Google AI Studio 上线,托管形式不提供开放权重。
vLLM 官方博客(RSS)AI 评分5555 vLLM 如何用 GB300 NVL72 为 Kimi K3 训练最快的 DSpark 投机解码模型
vLLM 团队扩展 Speculators 训练库,为 2.8T 参数的 Kimi K3 训练出 DSpark 投机解码 draft 模型,将数学推理单流交互速度从约 110 提升至约 435 tok/s/user,并发负载下输出吞吐最高提升约 3.5 倍。
Google Research:Blog(网页)AI 评分4444 Google 用 Retrieve-for-Train 框架突破推理瓶颈,加速复杂 AI 搜索
Google Research 提出 Retrieve-for-Train 框架,用离线强化学习将奖励对齐的查询扇出编译为监督信号,再蒸馏进一个 53.9M 参数的扩散检索器,实现推理时单次非自回归生成完整结果集,无需测试时 CoT 推理 token。该方法基于 Gemma3-4B 和 Qwen3-4B 微调,旨在解决零样本 LLM 的复述坍缩与自回归延迟瓶颈,论文已被 ICML 2026 收录。
elvis@omarsar0AI 评分6060NVIDIA Technical Blog:Agentic AI / Generative AIAI 评分5353 NVIDIA 技术博客解析 Dense 与 MoE 模型的参数激活、吞吐差异及选型方法
NVIDIA 技术博客讲解 dense 与 MoE 架构在参数激活、吞吐和部署上的差异,以 Nemotron 3.5 Lightning 为例说明 MoE 每词元仅激活约 3B 参数、总参数 30B 仍需约 60 GB 显存。文章给出按显存预算、并发、微调和量化需求选型的建议,并对比 Gemma 4 31B、Qwen3.8-27B、Mistral Small 4 等模型的输出速度与价格数据。
IT之家(RSS)AI 评分5252 Salesforce 联合英伟达推出推理大模型 Koa
Salesforce 在 Dreamforce 大会上发布首款推理大模型 Koa,基于英伟达开源权重的 Nemotron 模型由双方联合微调,主打销售、市场营销和客服类业务任务。Koa 将作为 Agentforce 平台可选模型,训练未使用真实客户数据,Token 消耗更低,可经 AI 网关自动调度;此前复杂推理任务依赖 Claude、ChatGPT 等外部前沿模型。
TechCrunch:AI(RSS)AI 评分5757 Salesforce 联合 Nvidia 发布首个推理模型 Koa,基于开源 Nemotron 面向销售与客服任务
Salesforce 在 Dreamforce 大会上发布首个推理模型 Koa,基于 Nvidia 开源权重的 Nemotron 模型,经后训练擅长销售、营销和客服任务,将作为 Agentforce 平台中 Claude 或 ChatGPT 等前沿模型的替代选项。
Ars Technica:AI(RSS)AI 评分7272 Mozilla 报告称中国开源模型与硅谷前沿模型差距缩至 4.4 个月
Mozilla 9 月 15 日发布的 State of Open Source AI 报告称,美国闭源前沿模型与中国最佳开源权重模型的性能差距已缩至 4.4 个月,Kimi K3 在 Artificial Analysis Intelligence Index 上仅落后 Anthropic Fable 5 三分,成本只有其 30%。
HuggingFace Daily Papers(社区热门论文)AI 评分5151 Orthrus 无损推测解码研究:BF16 下仅四成轨迹完全匹配,FP32 才完全一致
研究者独立复现 Orthrus 并检验其无损推测解码声明。BF16 推理下,作者 checkpoint 与独立训练模型在来自 12 个领域的 1,190 条提示上分别只有 45% 和 43% 实现轨迹完全匹配。
公众号:阶跃星辰(Step)精选AI 评分6666 阶跃星辰发布 StepAudio 3 系列语音大模型,多款在 Artificial Analysis 榜单全球第一
阶跃星辰发布 StepAudio 3 系列,包含 Realtime、ASR、TTS、Gen 和 Music 五款模型,已在阶跃星辰开放平台上线。
推荐理由:官方完整介绍了五款模型的能力与榜单成绩,可帮助读者了解语音模型在实时交互、理解和创作上的进展。
Dongxi 东锡 NLP@dongxi_nlpAI 评分6262文章讲解大模型推理的 prefill 与 decode 两个阶段:prefill 并行处理给定输入,决定 TTFT;decode 逐 token 自回归生成,常受内存带宽限制。
HuggingFace Daily Papers(社区热门论文)AI 评分5959 Atria Dawn Preview 发布:面向科研工程流程的智能体基座模型
Atria Dawn Preview 发布,一个面向科研与工程流程的智能体基座语言模型,通过 Verifiable Experience Pipeline 将工具交互连接到可执行环境和外部可验证结果进行训练。
HuggingFace Daily Papers(社区热门论文)AI 评分6161 Elo-per-token 分析揭示 LLM Agent 测试时算力策略的收益递减
论文提出 Elo-per-token 分析方法,用 Bradley-Terry 模型将任务内排序聚合为跨任务 Elo 评分,衡量 LLM Agent 测试时算力策略的扩展规律。
HuggingFace Daily Papers(社区热门论文)AI 评分5959 Zing-0.5 发布 5B 实时联合动作与文本控制世界模型
Zing-0.5 是一个 5B 自回归世界模型,支持键盘与文本联合控制,让用户在生成世界中导航并影响事件。技术要点包括统一动作与文本条件、事件级分布匹配蒸馏,以及四步生成加流式推理,在 832x480 分辨率下以 24 FPS 运行,估计服务器成本约每流分钟 0.009 美元;在 158 个 WBench Navigation 用例上取得总分 81.0 和一致性 88.5。
Latent Space(RSS)AI 评分6565 Richard Socher 谈 Recursive 与自我改进的 Eureka Machine 愿景
Latent Space 长篇访谈 Richard Socher,介绍其创办 Recursive(含 46.5 亿美元种子轮)与《The Eureka Machine》一书,押注递归自我改进式 AI。
SemiAnalysis 长文 RSS(RSS)AI 评分6161 SemiAnalysis 分析机器人智能应放机上还是放数据中心:B300 卸载 TCO 约为 Jetson Thor 机上方案的 46%
SemiAnalysis 长文分析通用机器人模型的智能应放在机器人本体还是数据中心。受实时性和单机成本约束,当前机器人模型仍为数十亿参数级,如 Physical Intelligence 的 π0 约 3B。
Dongxi 东锡 NLP@dongxi_nlpAI 评分5858Hacker News:AI 热帖AI 评分6565 普林斯顿团队研究显示AI智能体尚难独立完成开放式AI研究
普林斯顿大学Peter Kirgis和Sayash Kapoor牵头的多机构团队提出shadow evaluation方法,让运行在OpenClaw上的Claude Opus 4.8用六天、3000美元API额度和GPU预算复现两篇未发表的NeurIPS 2026论文研究。
Hacker News 热门(buzzing.cc 中文翻译)AI 评分6464 Claude Fable 5.1 破解已有 370 年历史的 Cyphral Distich 密码
Claude Fable 5.1 在 44 分钟、176k tokens 后破解了 Sir Thomas Urquhart 的 Cyphral Distich,这条 64 个数字的密码自 1899 年起被列为未解问题。
SemiAnalysis 长文 RSS(RSS)AI 评分6060 SemiAnalysis 长文解析:为什么 4-hi HBM 将成为推理最优配置
SemiAnalysis 长文论证 HBM 堆叠层数持续走高的趋势正在逆转,下一代 Rubin Ultra 每颗 GPU 的 HBM 将从 288GB 降至 192GB(8-hi)。
Rohan Paul@rohanpaul_aiAI 评分5555
Rohan Paul@rohanpaul_aiAI 评分5151MarkTechPost(RSS)AI 评分6666 Cognition 发布 SWE-2:基于 Kimi K3 后训练的编码模型,以低 64% 的成本接近 Fable 5.1
Cognition 发布编码模型 SWE-2,从 2.8T 参数的 Kimi K3 经强化学习后训练而来,在 FrontierCode 1.1 Main 得分 50.0%,与 Fable 5.1 相差不到 1 分且成本低 64%。
The Decoder:AI News(RSS)AI 评分5757 早期基准显示 GPT-6 Astra 空间推理出现台阶式提升
机器人基准 StationeryBench 在 200 次试验中对比 GPT-6 Astra 与 Ai2 MolmoAct2 控制同样的双臂 YAM 机器人完成五类桌面物体任务,Astra 完整完成 100 项任务中的 7 项、中位进展分 46,MolmoAct2 均为 0 和 12。
凡人小北@frxiaobeiAI 评分7272OpenAI 公开了 ChatGPT 背后的存储系统 Habitat,它每秒处理超过 7000 万次请求、保存 500PB 以上数据、服务每周超过 10 亿用户,最早只是一个 Python 小库。
Hacker News 热门(buzzing.cc 中文翻译)AI 评分5353 回顾性逆向工程苹果神经引擎:从 M1 ANE 架构看 NPU 为何衰落
作者曾是逆向 ANE Linux 驱动的开发者,三年后重新逆向 M1 上的 Apple Neural Engine,完整测绘其 16 计算核、2048 条 MAC 通道、任务描述符调度和内存层级。
The Verge:AI(RSS)AI 评分8383 The Verge 深度报道:OpenAI 以 88 小时解决 Navier-Stokes 引发数学界信任危机
The Verge 采访十余位数学家,梳理 OpenAI 用约 10,000 个 agent、数千万美元算力和 88 小时解决 Navier-Stokes 千禧年大奖难题后引发的争议。
The Decoder:AI News(RSS)AI 评分6464 25 位菲尔兹奖得主联合警告:AI 或在伤害数学及所有智力工作
25 位菲尔兹奖得主发布联合声明,警告 AI 行业与数学的目标严重错位,用 AI 批量攻克难题可能破坏学科真正的目的即概念性理解。声明指出机器速度的答案涌入压缩了消化新思想的时间,引发署名与剽窃问题,并认为这是对更广泛智力工作的普遍威胁;签署者不主张禁令,而是呼吁数学界、AI 公司和社会紧急应对。签署者包括 Terence Tao、Peter Scholze、Maryna Viazovska 等。
IT之家(RSS)AI 评分6565 25 位菲尔兹奖得主联合发表声明警告 AI 在数学领域严重错位
当地时间 9 月 11 日,陶哲轩、邓煜、Peter Scholze 等 25 位菲尔兹奖得主联合发表声明《A Severe Misalignment of AI in Mathematics》,警告 AI 公司与数学界目标严重错位。
Rohan Paul@rohanpaul_aiAI 评分5151HuggingFace Daily Papers(社区热门论文)AI 评分5959 StepAudio 3 Realtime 技术报告发布,实时语音中并行推理
StepAudio 3 Realtime 是一个围绕听-说-想-做循环组织的音频语言基础模型,通过 Deep Perception 解读声学线索,Seamless Duplex 处理停顿、附和与打断。
jason@jxnlcoAI 评分5555MarkTechPost(RSS)AI 评分5656 ByteDance Seed 等团队提出 HarnessDev,评测 LLM 自建的 Agent harness 仅 34/64 改动可泛化
ByteDance Seed 联合 SUTD、Georgia Tech、M-A-P 和 TokenWave.AI 提出 HarnessDev,评测对象是模型自己写出的可运行 agent harness 而非答案。