跳到正文

#推理

今日 2 条
9月3日周四
  1. François Chollet41

    François Chollet 发文称,所有 AI 不可避免会收敛于符号学习,即通过找到解释数据的最短符号程序来建模数据,因为这是效率最优的 AI 形式,但抵达这一目标可以有多条演化路径。他引用 @RTomMcCoy 团队历时 8 年的新论文作为佐证:LLM 虽与符号系统看似不同,却在语言、代码、数学等符号领域表现出色,研究发现 LLM 的表征具有隐式符号结构。

  2. HuggingFace Daily Papers(社区热门论文)45

    Cliff:从第一个错误学习过程奖励的 RLVR 奖励塑形策略

    论文提出 Cliff,一种奖励塑形策略,用现成 LLM 作为教师识别每次 rollout 中的第一个错误,将 rollout 分解为正确前缀和错误后缀,分别赋予正负 token 级优势。实验覆盖 12 个场景,Cliff 比.on-policy distillation 高 15%,比标准 GRPO 高 7%,即使教师能力一般也有效。

  3. HuggingFace Daily Papers(社区热门论文)44

    研究提出 Switch Distillation:中训练阶段知识蒸馏更利于推理而非事实记忆

    研究发现前向 KL 蒸馏在 pre-training 阶段同时提升推理与事实记忆,但在 mid-training 阶段会拖慢事实记忆习得,同时推理仍持续提升。作者提出 Switch Distillation,以教师预测熵作为路由信号,仅在教师置信的 token 上蒸馏,其余回退到交叉熵。

  4. HuggingFace Daily Papers(社区热门论文)44

    模仿学习能否保持灵巧操作的时间鲁棒性?专家与学习者在不同任务执行速度下的对比

    论文在 ParcelStow 接触密集任务中对比脚本专家与基于 ACT 训练的模仿策略在不同加速倍数下的表现,发现两者在名义速度下均为 100% 成功,但在最大演示速度下专家成功率为 84%,ACT 仅 53%,且两种不同参数初始化的 ACT 策略分别下降 34 和 48 个百分点,专家仅下降 16 个百分点。

  5. Sundar Pichai65

    Google 发布 Gemini 3.8 Flash,为 6 周内第 3 次 Flash 更新。官方称相较 3.7 Flash 在软件工程、智能体任务和多步推理上有显著提升,在 DeepSWE v1.1 上以更低成本自主端到端解决复杂工程问题,表现超越多数更大的前沿模型。图中基准显示其 Terminal-bench 2.1 得 89.4%、HLE-Verified 得 54.9%,输入价格 $0.75/1M tokens、输出 $3.75/1M tokens,为 2026 年 12 月 31 日前 introductory 价。详情见 https://blog.google/innovation-and-ai/models-and-research/gemini-models/3-8-flash-and-3-8-flash-cyber/

    推荐理由:原文给出模型能力变化、定价和多项基准对比,读者可据此评估它相对更大模型的性价比与适用场景。

  6. ARC Prize:官方博客79

    ARC Prize 发布 OpenAI GPT-6 Astra 在 ARC-AGI-3 上的评测结果

    ARC Prize 报告 OpenAI 的 GPT-6 Astra 在 ARC-AGI-3 Semi-Private 上,Standard harness 得分 62.7%(成本 $26K),Provider Adapter harness 得分 99.9%(成本 $19K),均为 SOTA。

    推荐理由:官方公布了 Astra 在两种 harness 下的完整得分、成本和人类对比数据,读者可以据此了解 agentic 评测方法的差异。

9月2日周三
  1. Hacker News 热门(buzzing.cc 中文翻译)54

    论文提出人工神经网络内部涌现出符号结构

    论文提出神经网络向量表示隐式实现了 Tensor Product Representation 符号结构,作者用 DISCOVER 方法将多种网络(含 Gemma-3-27b、GPT-2-XL、GPT-OSS-20b、Pythia-12b、Qwen3-14b、OLMo-2-13B、Llama-3.1-8b 共 7 个 LLM)的表示替换为符号化闭式方程,模型行为基本不变。