剑桥提出“无限参数LLM”:把对话上下文编译进权重,而非继续塞进提示词

剑桥大学研究者提出“无限参数LLM”:不把运行时信息持续塞进上下文,而是在会话中动态生成并调整权重补丁。该机制可减少重复读取上下文的成本,为长期记忆和参数化知识更新提供新路径,但泛化能力、等算力成本、可审计性和生产安全仍是待解问题。

当用户与一个大模型持续交流一小时,并多次纠正其错误后,关闭窗口再重新打开,模型往往仍然表现得像第一次见面。这不是简单的“记性不好”,而是当前大模型的一个结构性限制:权重在训练结束后便被冻结,运行时产生的新信息只能通过提示词、上下文窗口或检索系统临时注入。9 月 16 日,剑桥大学研究者 Jinli Hu、Ross M. Clarke、Yichuan Zhang 与 José Miguel Hernández-Lobato 在 arXiv 发布预印本论文《Infinite-Parameter LLMs: Generating and Adapting Weights from Live Data》,提出一种不同思路:不把运行时信息反复塞进上下文,而是尝试在会话过程中将其“编译进权重”。

这篇论文没有给出完整的基准测试结果,但其机制设计足够清晰:模型可以在交互中动态生成并调整一部分参数,从而减少重复读取上下文的开销,并为长期记忆和参数化知识更新提供新的可能。与此同时,论文也明确留下了多个尚未回答的问题,包括泛化能力、成本收益、可审计性以及生产部署中的安全边界。

从“临时记忆”到“会话级权重更新

现有大模型在部署后通常面临一个矛盾:最有价值的信息往往不在原始训练集中,而正在发生在当前对话里。用户随口补充的事实、对错误回答的纠正、持续明确的偏好,这些内容如果只能放进提示词,就会带来两个代价。

  • 重复计算:同一批背景事实需要在每一轮请求中重新读取,模型每次都要为同一份证据付出一次上下文处理成本。
  • 容量挤兑:上下文窗口有限,证据越多,留给推理的空间越少;一旦窗口饱和,早期信息就会被挤出。

为了解决这个问题,行业已经发展出一整套围绕“临时记忆”的工程方案,包括 RAG、记忆层、上下文压缩、提示缓存等。但它们本质上仍然是在不改变模型权重的前提下,尽量把信息塞进有限的工作内存中。

剑桥这篇论文试图改变信息存放的位置。其核心判断是:注意力层可以保持不变,只替换选定层的 FFN 子层。每个“生成层”由原始 FFN 与动态生成的补丁组成。补丁采用类似 LoRA 的低秩分解形式:

W(z) = W₀ + ΔW(z),其中 ΔW(z) = B(z) · A(z)ᵀ。论文给出的具体设置为秩 r=8,隐码维度 d_z=128,被调制的投影包括 W_gate、W_up 和 W_down。

关键在于,这套机制并不会真正把 ΔW 展开成完整权重,而是以因子形式直接计算:

y_delta = B(z) · (A(z)ᵀ · x)。

由于 r 只有 8,每个 token 的额外计算成本为 O(r(d+h)),相较基座 FFN 的 O(hd) 可以忽略。这也是论文使用“无限参数”这一名称的计算基础:参数空间可以极大,但每一刻的算力开销并不随之线性增长。

隐码从哪里来:从上下文中生成“专家”

动态权重的来源是隐码 z。论文设计了一条从输入序列到权重补丁的生成路径:输入序列后追加 M 个可学习的 memory tokens。这些 token 与具体输入无关,是一次训练后全局共享的固定探针。随后,冻结的 decoder-only 基座模型——论文中使用 Qwen3-8B——处理这些输入,并收集每一层 memory token 的隐状态,形成一个 memory grid。

之后,一个 memory-to-parameter 网络,即 M2P 网络,对该网格进行混合,输出扁平隐码 z,再通过平凡投影映射为每一层的 LoRA 因子。

如果把这套机制与已有架构对比,它更像是在 MoE 基础上做了一次改造。传统 MoE 是从一个固定专家库中选择一个已有专家;剑桥这篇论文则是根据当前会话数据现场生成一个专家,并在生成器前面加入一层贝叶斯式滤波。MoE 的专家库来自静态预训练,而这里的“专家”由当前交互数据编译出来。

论文也明确区分了自己与早期权重生成方法的不同。Text-to-LoRA、SHINE 等方法更接近“读一遍上下文,然后冻结”,生成的是一个点估计;而这篇论文在生成器的隐码上维护一个信念,并随会话在线更新。换句话说,生效的权重不是读一次就定死,而是随着对话推进被反复推导。

具体实现上,论文采用类别信念:

P_t(z) = Cat(π_t),并维护一个 code pool {m₁ … m_K}。其递推形式为:

π_t,k ∝ π_{t-1,k} · p(obs_t | z = m_k)。

打分后,每层进行 top-1 选择,而不是 top-k 混合。更强的连续高斯信念形式,例如加入零锚定偏移 ψ ~ N(0, Σ₀)、通过后验精度门控可塑性等,被论文明确列为未来工作,本次并未评估。

论文承认的四个未解问题

这篇预印本的价值并不只在于提出机制,也在于它对自身边界的描述相当克制。论文没有展示摘要级 benchmark 数字,并明确列出多个需要后续验证的问题。

第一,是“记忆”还是“泛化”。论文在相关工作中写道,权重生成器有一种有记录的失败模式:更容易记住,而不是泛化。如果模型只是把答案背下来,而不是学会如何使用信息,那么相比直接把证据放进 prompt,这套机制并没有明显优势,甚至还会增加“编译器”本身的开销。论文将这一点列为一等评估关注,但最终结论仍需要实验验证。

第二,是成本是否真正下降。外部评论指出,“amortized”只是关于成本转移到哪里的主张,并不等于总成本更低。论文提到的 17% 参数开销来自被复用的 SHINE 组件,并非本篇论文自身开销。真正关键的实验,是在同一算力预算下,与经过良好调优的检索系统比较总成本。摘要层面目前看不到这一结果。

第三,是离散信念的表达能力有限。当前类别信念是在整码之间选择,而不是在码空间中连续移动。如果会话中出现 code pool 中原本没有的“偏移”,系统只能通过物化一个新的 atom 来应对。K 个码对应 K 个离散行为模式,表达上难免粗糙、有台阶。这也是论文把连续高斯信念留作未来工作的原因。

第四,是“贝叶斯”并不自动成立。论文对这一概念的解释相当谨慎:后验的分散程度在摊销下恰恰是最脆弱的部分,因此这里的“贝叶斯”是关于后验是否校准良好的经验主张,而不是输出了一个分布就自动获得的性质。此外,精确似然需要 test-time 反向传播,部署时不可行,因此论文中的精确递归信念 P 只作为离线蒸馏教师和比较基线,而不是在线方案。

此外,社区在 Hacker News 上还提出了更偏生产环境的问题:权重随交互改写后,如何审计、如何复现、如何回滚?这些问题不是学术挑剔,而是决定该技术能否进入真实业务系统的硬条件。

评估协议与适用边界

虽然论文没有给出最终实验数字,但它提出了一套较完整的评估协议。协议围绕三个研究问题展开:动态权重是否能带来持续收益;是否能随交互改善;是否能比上下文方法更高效。

基线设计也分为多层,而不是只找一个简单对手。其中最受关注的是“匹配预算基线”:它堵住了“因为用了更多算力所以更好”的解释空间。任何声称“把上下文编译进权重更划算”的工作,如果不做等算力对比,结论都难以成立。

从工程落地角度看,这条路线并不适合所有场景。如果用户需要解决的只是“模型记不住上一轮信息”,而相关信息只会使用一两次,那么直接放进 prompt 更合理,编译一次的成本可能收不回来。如果同一批事实会在长会话、固定人设或稳定知识库中每轮重读,且信息量较小、干净、窗口放得下,优先优化检索与提示缓存仍然是更稳妥的选择。

如果信息量大、噪声多、需要多跳推理,并且这些内容在会话内稳定、反复使用,又不希望长期占据上下文窗口,剑桥提出的权重编译路线才更接近目标场景。但如果需要跨会话永久记住,或者需要可审计、可回滚,外部存储加检索仍然是现阶段更可行的方案。

它不替代 RAG,而是填补中间地带

把这一机制放进“记忆放在哪里”的版图中,可以更清楚地看到它的位置。上下文窗口适合短时工作记忆,成本低但每轮重读、容量有限;外部存储和 RAG 适合长期知识库,容量大且可审计,但存在检索往返和拼接成本;权重编译则介于两者之间:一次编译,每轮只承担极小的因子化增量,但可审计性较低。

因此,它并不是要替代 RAG,而是试图填补一个中间缝隙:会话内稳定、反复使用、且不希望持续出现在上下文里的内容。例如长对话中逐渐明确的用户偏好、约束条件、术语约定等。这类信息今天要么占据窗口,要么每次重新检索,确实缺乏更合适的存放位置。

这项研究更重要的意义,也许不在于当前机制的性能,而在于它重新定义了“交互”的角色。过去几年,行业通常把实时交互视为一次性的填充物:用提示词装进去,用完即丢。而这篇论文提出,交互本身可以成为训练信号,模型可以在对话进行中现场调整自己。如果这一路线的某个分支能够走通,RAG 与上下文工程要解决的问题清单都可能被重写。

更远处看,这条路线与“基座冻结、生成器冻结、信念动态”的趋势一致。冻结部分保证一致性与安全,动态部分提供适应性。参数不再需要在训练阶段把所有知识一次性固化进巨大权重中。

但代价同样明确:权重因为交互而改变,意味着系统更难复现、更难审计。一段被恶意纠正的对话,理论上可能悄悄改变模型后续行为。可解释性和安全,将是这条路线绕不开的下一关,也是能否进入生产环境的入场券。

目前,这篇论文展示的是一套机制设计和评估框架,而非可以直接采用的成熟方案。它提出了一种有别于上下文工程的长期记忆路径,但真正决定其价值的,仍是后续实验能否回答四个问题:是否泛化而非死记;是否在等算力下优于检索;是否能从离散信念走向更连续的表达;以及是否能满足审计、复现和回滚等生产要求。

原创文章,作者:点点,如若转载,请注明出处:https://www.dian8dian.com/jian-qiao-ti-chu-wu-xian-can-shu-llm-ba-dui-hua-shang-xia

Like (0)
点点的头像点点
Previous 2小时前
Next 13 mins ago

相关推荐