# 无限参数大模型：把用户现场给的信息直接写进模型权重里

> 原标题：Infinite-Parameter LLMs: Generating and Adapting Weights from Live Data

- 来源：Hacker News 首页
- 发布时间：2026-09-17T16:55:14.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/57152
- 原文：https://arxiv.org/abs/2609.18842

## 摘要

这篇论文提了一个新架构，核心想法是：用户对话时提供的实时信息（比如补充的事实、纠正的指令）不再塞进提示词里反复读，而是当场生成一小块模型权重，直接修改模型的前馈网络。具体做法是用一个紧凑的超网络，把实时数据转换成对共享基座模型的低秩调制，相当于每次只动一小部分参数。更特别的是，它维护了一个对生成器潜变量的贝叶斯信念，并在对话过程中在线更新，让有效权重随...

## 推荐理由

这篇论文的架构想法挺新鲜：把用户对话里的实时信息直接变成模型权重，而不是让模型反复读提示词。超网络加贝叶斯在线更新的设计让这个思路有了可操作的机制，不只是概念。但正文没披露任何产品化路径或实验室背景，目前还停留在纸面，对一线干活的人影响有限，所以先打个折，放在 featured 里让大家知道有这么个方向。

## 锐评

这篇论文提了一个挺有意思的方向：不让模型反复从提示词里读用户给的实时信息，而是当场生成一小块权重，直接修改模型的前馈网络。具体做法是用一个紧凑的超网络，把实时数据转换成对共享基座模型的低秩调制，相当于每次只动一小部分参数。更特别的是，它维护了一个对生成器潜变量的贝叶斯信念，并在对话过程中在线更新，让有效权重随对话轮次演化，而不是一次读完就固定。

作者声称这样做有几个好处：省下上下文窗口、信息能跨轮次记住、泛化可能比塞进提示词更好。但正文没披露任何具体实验、模型规模或延迟数据，目前只是一个架构设想和评估协议。这点先别太激动，想法虽好，但超网络生成权重本身的计算开销、在线贝叶斯更新的稳定性，以及实际能省多少上下文窗口，都还是未知数。

还缺的关键信息是：这套方法在多大模型上验证过、生成权重的延迟比直接读提示词高多少、以及所谓的“泛化更好”有没有具体数字支撑。
