#推理
#推理
今日 2 条
François Chollet@fcholletAI 评分4141HuggingFace Daily Papers(社区热门论文)AI 评分4545 Cliff:从第一个错误学习过程奖励的 RLVR 奖励塑形策略
论文提出 Cliff,一种奖励塑形策略,用现成 LLM 作为教师识别每次 rollout 中的第一个错误,将 rollout 分解为正确前缀和错误后缀,分别赋予正负 token 级优势。实验覆盖 12 个场景,Cliff 比.on-policy distillation 高 15%,比标准 GRPO 高 7%,即使教师能力一般也有效。
HuggingFace Daily Papers(社区热门论文)AI 评分7272 Nemotron-3 系列后训练模型在 IOI 编程竞赛中超过人类最高分
论文提出端到端后训练管线,用 22,000 道精选题目、合成推理轨迹、SFT 和 RL 训练 Nemotron-3-Nano-CC(30B-A3B),并以 SFT 训练 Nemotron-3-Ultra-CC(550B-A55B),同时引入迭代生成、评估和改进解法的 GenCorrect 测试时计算策略。
🚨 AI News | TestingCatalog@testingcatalogAI 评分2525TestingCatalog 称 GPT-6-Astra 模型 slug 已出现在 OpenAI API 上,推测若明天发布将是重要一周,并猜测可能先上线路由功能。
IT之家(RSS)AI 评分5757 西班牙公司 Multiverse Computing 推出 Quasar 438B 模型,1M 词元上下文
西班牙 AI 公司 Multiverse Computing 推出 4,380 亿参数的推理模型 Quasar 438B,在 Artificial Analysis Intelligence Index v4.1.1 得分 43,为参与比较的欧洲模型中最高。
IT之家(RSS)AI 评分6666 Meta 发布 Muse Spark 1.3,主打编码与长周期智能体任务
Meta 于 2026 年 9 月 2 日发布 AI 模型 Muse Spark 1.3,专为延长智能体工作流与增强编码能力设计,Meta 首席 AI 官 Alexandr Wang 称其编码能力超越 GPT-5.6 Sol、与 Claude Fable 5.1 持平。
HuggingFace Daily Papers(社区热门论文)AI 评分4444 研究提出 Switch Distillation:中训练阶段知识蒸馏更利于推理而非事实记忆
研究发现前向 KL 蒸馏在 pre-training 阶段同时提升推理与事实记忆,但在 mid-training 阶段会拖慢事实记忆习得,同时推理仍持续提升。作者提出 Switch Distillation,以教师预测熵作为路由信号,仅在教师置信的 token 上蒸馏,其余回退到交叉熵。
HuggingFace Daily Papers(社区热门论文)AI 评分4444 模仿学习能否保持灵巧操作的时间鲁棒性?专家与学习者在不同任务执行速度下的对比
论文在 ParcelStow 接触密集任务中对比脚本专家与基于 ACT 训练的模仿策略在不同加速倍数下的表现,发现两者在名义速度下均为 100% 成功,但在最大演示速度下专家成功率为 84%,ACT 仅 53%,且两种不同参数初始化的 ACT 策略分别下降 34 和 48 个百分点,专家仅下降 16 个百分点。
Rohan Paul@rohanpaul_aiAI 评分6161
Dongxi 东锡 NLP@dongxi_nlpAI 评分2626
Ethan Mollick@emollickAI 评分4040
Rohan Paul@rohanpaul_aiAI 评分5252
Artificial Analysis@ArtificialAnlysAI 评分6969TechCrunch:AI(RSS)AI 评分5858 OpenAI 新推理技术引发 AI 安全专家担忧:Astra 采用不透明循环或影响链式思维监控
据 The Information 报道,OpenAI 新模型 Astra 将使用名为 recurrent depth(不透明循环)的推理技术,让模型以循环方式多次处理同一查询,留下更少的可读痕迹,可能使链式思维更难监控。
Rohan Paul@rohanpaul_aiAI 评分6666
elvis@omarsar0AI 评分1717Elvis Saravia 发推称,感觉我们正处在 RSI(递归自我改进)的早期阶段。他表示过去一个月情况发生了巨大变化,并问大家是否注意到近期模型发布的速度。
Ars Technica:AI(RSS)AI 评分6363 Google 发布 Gemini 3.8 Flash,六周内第三款 Flash 模型
Google 发布 Gemini 3.8 Flash,称其为此前最佳的推理与编码模型,这是六周内的第三款 Flash 模型,另推出面向漏洞检测与缓解的 Gemini 3.8 Flash Cyber。
The Decoder:AI News(RSS)AI 评分7979 美国司法部在纽约时报版权案中支持 AI 训练属合理使用
美国司法部在纽约时报等起诉 OpenAI 和 Microsoft 的合并诉讼中提交意见,主张用版权材料训练 LLM 属于合理使用,理由是训练复制与模型输出之间存在法律区分,且输出通常与原作缺乏实质性相似。
elvis@omarsar0AI 评分3434The Decoder:AI News(RSS)AI 评分7575 Google 发布 Gemini 3.8 Flash,六周内第三款 Flash 模型
Google 发布 Gemini 3.8 Flash,含通用版和面向经审核防御者的 3.8 Flash Cyber。
The Verge:AI(RSS)AI 评分7171 OpenAI Astra 发布在即,研究人员担忧其架构更难监控
OpenAI 推迟发布最强模型 Astra 以加强安全协议,The Information 报道称 Astra 可能采用更不透明的 recurrent depth / looped transformer 技术,内部思考更难监测。
Google DeepMind:Blog(RSS)精选AI 评分7878 Google DeepMind 发布 Gemini 3.8 Flash 与 3.8 Flash Cyber 两款新模型
Google DeepMind 发布 Gemini 3.8 Flash 与 3.8 Flash Cyber。
推荐理由:官方给出两版模型的定价、基准成绩和实际安全应用数据,读者可据此评估在新旧 Flash 模型间的迁移与选型。
IT之家(RSS)AI 评分5757 谷歌低调上线 Gemini 3.8 Flash 模型,面向软件工程与智能体任务
谷歌 9 月 2 日在 Google DeepMind 网站低调上线 Gemini 3.8 Flash 模型,基于 Gemini 3.7 Flash,截至发稿官方尚未通过新闻稿或社媒官宣。
Sundar Pichai@sundarpichai精选AI 评分6565推荐理由:原文给出模型能力变化、定价和多项基准对比,读者可据此评估它相对更大模型的性价比与适用场景。
Rohan Paul@rohanpaul_aiAI 评分7070Google 发布 Gemini 3.8 Flash,这是 6 周内第 3 次更新的 Flash 模型,官方称智能体与编码能力再次提升。
Google AI Developers@googleaidevsAI 评分4444
Ammaar Reshi@ammaarAI 评分6666Hacker News 热门(buzzing.cc 中文翻译)AI 评分5454 Multiverse Computing 发布 Quasar 438B 推理模型,自称欧洲领先
Multiverse Computing 发布首款大模型 Quasar 438B,定位面向企业级智能体和编码的推理模型,支持英文和西班牙语。
Google AI@GoogleAIAI 评分6262ARC Prize:官方博客精选AI 评分7979 ARC Prize 发布 OpenAI GPT-6 Astra 在 ARC-AGI-3 上的评测结果
ARC Prize 报告 OpenAI 的 GPT-6 Astra 在 ARC-AGI-3 Semi-Private 上,Standard harness 得分 62.7%(成本 $26K),Provider Adapter harness 得分 99.9%(成本 $19K),均为 SOTA。
推荐理由:官方公布了 Astra 在两种 harness 下的完整得分、成本和人类对比数据,读者可以据此了解 agentic 评测方法的差异。
Google Gemini@GeminiAppAI 评分5757
Artificial Analysis@ArtificialAnlysAI 评分6565
elvis@omarsar0AI 评分4949
🚨 AI News | TestingCatalog@testingcatalogAI 评分6262
Rohan Paul@rohanpaul_aiAI 评分4242
DogeDesigner@cb_dogeAI 评分5151
Rohan Paul@rohanpaul_aiAI 评分6868
Rohan Paul@rohanpaul_aiAI 评分4848Hacker News 热门(buzzing.cc 中文翻译)AI 评分5454 论文提出人工神经网络内部涌现出符号结构
论文提出神经网络向量表示隐式实现了 Tensor Product Representation 符号结构,作者用 DISCOVER 方法将多种网络(含 Gemma-3-27b、GPT-2-XL、GPT-OSS-20b、Pythia-12b、Qwen3-14b、OLMo-2-13B、Llama-3.1-8b 共 7 个 LLM)的表示替换为符号化闭式方程,模型行为基本不变。
Hacker News 热门(buzzing.cc 中文翻译)AI 评分3737 Baseten 工程师解析 LLM 推理的有效边界与两类优化技术
Baseten 工程师 Philip Kiely 撰文解析 LLM 推理的"有效边界"框架,将推理技术分为两类:在延迟与吞吐之间做取舍以命中边界上某一点的技术,以及把整条边界外推、创造整体效率提升的技术。