跳到正文
Hacker News 首页

无限参数大模型:把用户现场给的信息直接写进模型权重里

Infinite-Parameter LLMs: Generating and Adapting Weights from Live Data

这篇论文提了一个新架构,核心想法是:用户对话时提供的实时信息(比如补充的事实、纠正的指令)不再塞进提示词里反复读,而是当场生成一小块模型权重,直接修改模型的前馈网络。具体做法是用一个紧凑的超网络,把实时数据转换成对共享基座模型的低秩调制,相当于每次只动一小部分参数。更特别的是,它维护了一个对生成器潜变量的贝叶斯信念,并在对话过程中在线更新,让有效权重随...

推荐理由:这篇论文的架构想法挺新鲜:把用户对话里的实时信息直接变成模型权重,而不是让模型反复读提示词。超网络加贝叶斯在线更新的设计让这个思路有了可操作的机制,不只是概念。但正文没披露任何产品化路径或实验室背景,目前还停留在纸面,对一线干活的人影响有限,所以先打个折,放在 featured 里让大家知道有这么个方向。

读原文 ↗导出 Markdown