跳到正文
Hacker News 首页

别再把大模型叫“下一个词预测器”了

Stop Thinking of LLMs as Next-Token Predictors

说大模型是“下一个词预测器”技术上没错,但漏了关键:后训练阶段(尤其是RLVR)让模型自己探索新序列、从奖励中学习,而不只是模仿已有文本。作者用下棋打比方:一个系统从棋谱数据库里预测大师下一步走哪,另一个系统穷举所有可能棋局再选赢面最大的走法——后者显然不是“下一步预测器”。文章没点名具体模型,但解释了RLHF和RLVR如何把模型从“模仿”变成“模拟+...

读原文 ↗导出 Markdown