在过去数年里,大语言模型(LLM)能力的跃升在很大程度上被归因于规模法则(Scaling Laws)——即参数量、训练数据规模以及计算预算的协同扩张。然而,随着模型推理上下文的不断拓展、长程复杂任务的持续涌现,以及智能体(Agent)范式的深入演化,一个同样基础却长期被分散讨论的架构维度正逐渐走向前台:记忆(Memory)。
传统的语言模型中,记忆往往以一种隐式、瞬态的方式存在于前向计算流之中——最典型的便是 Transformer 的自注意力机制及其生成的 Key-Value(KV)缓存。这种机制虽具备灵活的基于内容寻址能力,但其二次方计算开销与线性增长的显存占用,使其在面对超长上下文与多轮持续交互时面临严峻的资源瓶颈。
为应对这一挑战,学术界与工业界近年来涌现出大量探索:从以 Mamba、RWKV-7、Gated DeltaNet 为代表的高效循环与状态空间模型,到以 Titans、TTT(Test-Time Training)为代表的测试期动态参数更新,再到 Engram 等基于可扩展哈希查找的显式存储模块,以及 MoE 架构中的条件参数激活。然而,这些研究大多分散在高效序列建模、长上下文推理、测试期自适应及外部存储等不同细分领域,缺乏统一的形式化框架与概念对照。
近期,来自清华大学、新加坡国立大学与博世人工智能研究院的研究团队撰写了综述论文《Memory for Large Language Models》,首次从模型底层架构与计算机制的视角,对大语言模型中的记忆系统进行了系统性的梳理与解构,提出了涵盖表示形式、更新动力学和持久性三个正交维度的分类体系,并深入剖析了混合记忆架构的设计权衡、系统级效率优化及多维度评测范式。
论文链接:https://arxiv.org/pdf/2607.25380
记忆范式的演进:从隐式计算副产物到第一架构公民
在大模型发展的早期阶段,记忆并未被视作一个独立的架构组件,而是紧密依附于前向计算图的瞬态副产物。在标准 Transformer 架构中,历史上下文信息被即时编码为注意力状态,并在当前推理步骤结束后随之释放或阶段性丢弃。
随着任务复杂度的提升,记忆的形态正发生根本性转向:
这一范式转变促使研究团队重新审视“模型记忆”的本质,并建立能够统摄不同技术路线的系统性认知框架。
图1|大语言模型记忆机制的演进。记忆逐渐从依附于前向计算的隐式状态,发展为具备独立表示、更新与持久化能力的架构维度。
统一分类体系:三维正交视角
针对文献中对“记忆”一词指代模糊、抽象层次不一的问题,该综述明确将讨论范围限定在模型级(Model-level)记忆机制——即在模型架构或其推理动力学内部实例化的记忆,排除了依赖外部编排流程或提示工程的纯智能体级系统。在此基础上,综述提出了由三个正交轴构成的三维分类框架。
图2|综述框架与分类体系。三个主轴分别刻画记忆如何表示、何时及如何更新,以及能够维持多长时间的有效影响。
1.表示形式(Representation):隐式记忆 vs. 显式记忆
该维度界定了记忆在模型内部的物理存在形态与访问接口:
该维度界定记忆被修改的时间节点与触发机制:
为了更深入地刻画在线机制的微观行为,综述进一步提炼出五种细粒度更新规则(Fine-Grained Update Rules):
该维度关注存储信息对模型后续计算产生有效影响的时间跨度:
表1|代表性工作的分类汇总。表格按照各模型的主要记忆机制,归纳其更新动力学、持久性与核心范式;部分方法同时具有多个维度的混合属性。
隐式记忆:基于计算动力学的上下文建模
隐式记忆是现代深度序列模型的基础。它不依赖外部存储接口,而是利用前向计算过程本身实现历史信息的汇聚与传递。
1.注意力作为内容寻址瞬态工作记忆
自注意力机制可被数学化地解释为一种连续可微的内容寻址工作记忆(Content-Addressable Memory,CAM)。然而,完全注意力机制受限于二次方复杂度与 KV 显存开销。近期研究通过 Multi-head Latent Attention(MLA)对键值联合压缩,或通过 StreamingLLM 的“注意力汇(Attention Sinks)”机制维持滑动窗口下的生成稳定性。HyperMLP 等新工作则进一步将注意力重构为输入条件化的序列混合算子,展现了隐式记忆访问几何的多样性。
2.稀疏、选择性与结构化访问控制
为突破上下文容量瓶颈,研究团队在注意力中引入了准入与稀疏路由机制:
不同于注意力的全历史保留,循环序列模型将历史压缩为固定或对数增长维度的隐藏状态:
图3|隐式记忆机制。注意力保留细粒度 KV 状态,稀疏与选择机制控制访问范围,循环序列记忆则通过 RNN、线性注意力或 SSM 状态压缩历史。
显式记忆:解耦寻址与自适应存储
尽管隐式记忆计算效率高,但其容量受限于隐状态维度,且难以脱离前向图实现持久化与受控修改。显式记忆通过解耦存储基质与瞬态计算,为大模型提供了更为开阔的扩展空间。
1.参数化外部记忆模块
借鉴经典快速权重(Fast Weights)与神经图灵机(DNC)思想,前沿模型开始将专门的参数子空间作为在线记忆载体:
该路线旨在为模型提供直接可寻址的离散或密集存储表:
Mixture-of-Experts(MoE)架构通常被视作稀疏计算技术,但从记忆视角审视,每一个 Expert 实质上是参数空间中的一个模块化知识块。路由器(Router)根据输入语义执行上下文寻址。DeepSeek-MoE 与 Mixtral 的细粒度专业化分工,展现了条件参数作为结构化离线记忆的有效性。
4.多时间尺度与嵌套更新
记忆的生命周期不应是非黑即白的。Nested Learning 与 Slow-Fast 参数分解机制表明,在大模型内部构建多更新频率的层级结构(从逐 Token 演化的瞬态状态,到按批次/会话更新的快速权重,再到冻结的骨干网络),是化解持续学习中“稳定性-可塑性困境(Stability-Plasticity Dilemma)”的重要途径。
图4|显式记忆机制。参数化模块、可寻址存储、条件参数路由与多时间尺度更新,分别提供了不同程度的存储独立性与更新控制能力。
混合记忆架构与系统级考量
单一记忆范式难以兼顾高保真召回、无限长外推、低计算延迟与跨会话持久性。因此,混合记忆架构(Hybrid Memory Architectures)正成为当前模型设计的核心演进方向。
1.混合范式的典型模式
在落地部署层面,PagedAttention(内存虚拟化)、CommVQ(KV 缓存矢量量化)以及 Memory Caching(循环状态快照缓存)等技术重塑了显存带宽与吞吐的物理边界。
在评测层面,传统的困惑度(Perplexity)已无法完整反映记忆品质。综述指出,必须建立涵盖检索保真度(如 Needle-in-a-Haystack、RULER)、长程结构推理(如 SCROLLS)、干扰抗性与遗忘速度、以及显存-吞吐效率曲线的多维评测矩阵,才能精确解构模型真实具备的记忆能力。
开放挑战与未来方向
针对大语言模型记忆机制的研究仍处于快速演变期,综述指出了六个亟待突破的前沿方向:
从依赖前向计算的隐式、瞬态状态,走向具备自主寻址与受控更新能力的显式、持久记忆系统,大语言模型正在经历深刻的底层架构重塑。本综述提出的机制中心型分类体系与权衡分析,不仅厘清了当前碎片化的研究脉络,也为构建下一代高扩展、高可塑与自主进化的大模型记忆架构提供了系统性的方法论参考。