跳到正文

#推理

今日 2 条
9月29日周二
9月28日周一
  1. MarkTechPost(RSS)78

    Fireworks AI 发布 Ember-1:基于 Kimi K3 的后训练模型,推理 Token 减少约 40%

    Fireworks AI 推出 Ember-1,这是基于 Moonshot AI 开源权重 Kimi K3 进行后训练的专用模型。该模型通过优化内部推理过程,在保持任务准确率的同时将生成的推理 Token 减少了约 40%。与单纯降低推理努力程度不同,Ember-1 保留了有用的自我反思并削减了冗余循环。基准测试显示,其在 Terminal Bench 2.1 和 DeepSWE 1.1 上表现优于 K3 Max,且在生产环境 A/B 测试中实现了显著的成本节约。目前仅通过 Fireworks Serverless API 以研究预览形式提供,未开放权重。

9月27日周日
  1. HuggingFace Daily Papers(社区热门论文)34

    SciGen-Verifier:面向科学图像生成可解释验证的多模态推理器

    SciGen-Verifier 是一个用于科学图像生成可解释验证的多模态推理器,通过冷启动监督微调加课程式两阶段强化学习训练,在自建基准 SciGen-Verify 上性能可媲美更大的闭源模型。该基准覆盖指令遵循、多学科推理与世界知识,采用二值判断、解释与纠错编辑指令的三层协议。它还可作为在线 critic 用于图像的迭代修正。

  2. HuggingFace Daily Papers(社区热门论文)38

    EAPO:面向 LLM 推理探索的熵引导信用分配方法

    针对 RLVR 中细粒度信用分配依赖辅助模型或额外采样的问题,研究者提出熵引导信用分配方法 EAPO,将归一化策略熵与响应优势符号耦合,对成功响应中的高熵决策加强强化、对失败响应中的低熵决策加强惩罚,同时衰减不确定位置的惩罚以保留恢复机会。

  3. Arena.ai78

    Arena 宣布 Claude Opus 5.5 (High) 以 1509 分首次登顶 Text Arena,比 Opus 5 (High) 高 18 分(现列第 11)。Opus 4.6 (High) 以 4 分之差保持第 2,Anthropic 包揽该榜前六名;Opus 5.5 (High) 按每百万 token 输入/输出定价折算的混合价格为 $16/MToken,进入 Text Arena 的 Pareto 前沿。

    推荐理由:原文给出具体排名、分数差和混合价格,读者可据此比较 Claude Opus 5.5 与前代的性价比位置。

9月26日周六
  1. Hacker News 热门(buzzing.cc 中文翻译)53

    Amit Sahai:AI 时代我们还需要更多的数学家

    数学家 Amit Sahai 在 Terence Tao 博客发文,认为 AI 已在产生超越人类即时理解的新数学思想,人类群体将普遍面临跟不上 AI 的体验。他主张以集体投入和扩充数学研究者规模来理解 AI 突破,并以 AI 提出全新核聚变电站设计的设想说明独立人类专家在重大决策中理解模型与安全依据的必要性。

  2. HuggingFace Daily Papers(社区热门论文)36

    重新审视 LLM 强化学习中的训练-推理不匹配:来源与校正方法

    研究揭示 LLM 强化学习(RLVR)中训练引擎与推理引擎对同一 token 赋予不同概率的问题,并提出校准重要性采样(CIS)进行校正。CIS 基于 logit 位移刻画,采用置信度感知截断:大正位移在单一常数阈值处截断,映射为随 token 置信度升高而收紧的重要性比率上限。在三个 MoE 模型和五个数学推理基准上,CIS 均取得最高五基准平均分。

  3. Anthropic:Research(发表成果 · 网页)70

    Claude 完成 N=4 super Yang-Mills 九圈散射振幅计算,物理学家 Matt von Hippel 撰文回顾挑战过程

    物理学家 Matt von Hippel 发起的挑战达成:Anthropic 的 Liam Fitzpatrick 与 Siddharth Mishra-Sharma 用 Claude Science(harness)让 Claude 直接算出 planar N=4 super Yang-Mills 六粒子振幅九圈结果。

    推荐理由:作者以其曾判定过难的本领域前沿计算为参照,评估了 Claude Science 的实际能力与可推广性,提供了来自领域专家的一手判断。

9月25日周五
  1. HuggingFace Daily Papers(社区热门论文)51

    PUBG Ally:PUBG 中可语音对话的具身智能体队友

    论文介绍 PUBG Ally,一个在 PUBG: BATTLEGROUNDS 中作为语音队友的具身智能体,可感知动态游戏环境并自主行动。语言模型智能体通过受控接口检查游戏信息、理解玩家语音并下发高层动作,交给更快的控制层执行移动、战斗和恢复;团队基于近 39k 场真实玩家共玩对局的数据做迭代训练,并通过模型压缩、上下文压缩、安全训练和运行时护栏实现低延迟端侧部署与玩家沟通安全。

  2. HuggingFace Daily Papers(社区热门论文)35

    ARGUS:基于语言模型的气候政策因果评估审计框架

    研究提出 ARGUS,一种结构化语言模型流水线,用于审计气候政策差分法(DID)研究中的识别假设证据。ARGUS 依据十一维假设-含义-证据准则进行评估,并在无法检索相关证据时选择弃权。在注入缺陷的基准测试中,ARGUS 检测到 73% 的植入缺陷,显著高于关键词基线的 18%。在经济学论文评估中,约 40% 的维度因缺乏可检索证据而弃权。该工具旨在为专家审查提供风险定位报告,而非直接裁定因果主张。代码与数据已开源。

  3. HuggingFace Daily Papers(社区热门论文)39

    提出连续深度批处理技术,实现循环语言模型的高效自适应推理

    针对循环语言模型(Looped LMs)中不同 token 循环次数不同导致无法使用标准批处理系统的问题,研究者提出了“连续深度批处理”(CDB)方法。该方法通过在循环步骤间动态构建新批次、管理 KV 缓存及预测退出时机,实现了高效的深度自适应推理。实验表明,全循环架构最适合此方法,CDB 可实现高达 99% 的预估最大加速比。