Hacker News 热门(buzzing.cc 中文翻译)· garrinm·· 2026-09-05AI 评分45
为什么下一个令牌预测器是对 LLM 的错误思维模型
“下一个令牌预测器”是针对大型语言模型(LLMs)的一种错误的思维模型
AI 导读
作者认为下一个令牌预测器只是对 LLM 的零阶近似,机制形态正确但不完整。现代后训练中的 RLVR 让模型通过自己探索生成的新序列并获得奖励来学习,类似会穷尽探索的象棋引擎而非模仿大师棋谱的下一步预测器,因此 RLHF 和 RLVR 编码的内容早已超出对现有文本的预测。
整理与数据来源:AIHOT
来源:Hacker News 热门(buzzing.cc 中文翻译) · gmcgoldr.github.io