跳到正文

#推理

今日 2 条
9月16日周三
  1. Hacker News 热门(buzzing.cc 中文翻译)59

    为什么在纳维-斯托克斯方程之后,我仍然对大型语言模型持看空态度

    作者认为前沿实验室按'即将实现知识工作全自动化'的叙事定价,但当前模型在训练任务的小邻域之外容易彻底失败或奖励作弊,纳维-斯托克斯这类纯数学成果依赖定理即严格规约、Lean 验证器经多年审计的最佳条件,无法推广到大多数知识工作。

  2. Google Research:Blog(网页)44

    Google 用 Retrieve-for-Train 框架突破推理瓶颈,加速复杂 AI 搜索

    Google Research 提出 Retrieve-for-Train 框架,用离线强化学习将奖励对齐的查询扇出编译为监督信号,再蒸馏进一个 53.9M 参数的扩散检索器,实现推理时单次非自回归生成完整结果集,无需测试时 CoT 推理 token。该方法基于 Gemma3-4B 和 Qwen3-4B 微调,旨在解决零样本 LLM 的复述坍缩与自回归延迟瓶颈,论文已被 ICML 2026 收录。

  3. NVIDIA Technical Blog:Agentic AI / Generative AI53

    NVIDIA 技术博客解析 Dense 与 MoE 模型的参数激活、吞吐差异及选型方法

    NVIDIA 技术博客讲解 dense 与 MoE 架构在参数激活、吞吐和部署上的差异,以 Nemotron 3.5 Lightning 为例说明 MoE 每词元仅激活约 3B 参数、总参数 30B 仍需约 60 GB 显存。文章给出按显存预算、并发、微调和量化需求选型的建议,并对比 Gemma 4 31B、Qwen3.8-27B、Mistral Small 4 等模型的输出速度与价格数据。

9月15日周二
  1. IT之家(RSS)52

    Salesforce 联合英伟达推出推理大模型 Koa

    Salesforce 在 Dreamforce 大会上发布首款推理大模型 Koa,基于英伟达开源权重的 Nemotron 模型由双方联合微调,主打销售、市场营销和客服类业务任务。Koa 将作为 Agentforce 平台可选模型,训练未使用真实客户数据,Token 消耗更低,可经 AI 网关自动调度;此前复杂推理任务依赖 Claude、ChatGPT 等外部前沿模型。

  2. HuggingFace Daily Papers(社区热门论文)59

    Zing-0.5 发布 5B 实时联合动作与文本控制世界模型

    Zing-0.5 是一个 5B 自回归世界模型,支持键盘与文本联合控制,让用户在生成世界中导航并影响事件。技术要点包括统一动作与文本条件、事件级分布匹配蒸馏,以及四步生成加流式推理,在 832x480 分辨率下以 24 FPS 运行,估计服务器成本约每流分钟 0.009 美元;在 158 个 WBench Navigation 用例上取得总分 81.0 和一致性 88.5。

9月14日周一
  1. Dongxi 东锡 NLP58

    DeepSeek 发布 DeepSeek-V4.1-Flash,一款 552B 参数(每 token 激活 16B/预填充 8B)的多模态 MoE 模型,支持最长一百万 token 上下文。其 Causal Encoder-Decoder(CED)架构结合 CSA2 与 FP4 KV caching,将全局 KV cache 降至每 token 890 字节,约为 DeepSeek-V4-Flash 的 1/4、DeepSeek-V1 的 1/437,配合 SWA Bounded Replay 将持久 KV cache 降至约 1/8,性能仍优于基线。模型基于 45T token 多模态语料预训练,checkpoint 已在 https://huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash 开放。

9月13日周日
9月12日周六
  1. The Decoder:AI News(RSS)64

    25 位菲尔兹奖得主联合警告:AI 或在伤害数学及所有智力工作

    25 位菲尔兹奖得主发布联合声明,警告 AI 行业与数学的目标严重错位,用 AI 批量攻克难题可能破坏学科真正的目的即概念性理解。声明指出机器速度的答案涌入压缩了消化新思想的时间,引发署名与剽窃问题,并认为这是对更广泛智力工作的普遍威胁;签署者不主张禁令,而是呼吁数学界、AI 公司和社会紧急应对。签署者包括 Terence Tao、Peter Scholze、Maryna Viazovska 等。