Memory Decoder: A Pretrained, Plug-and-Play Memory for Large Language Models
Memory Decoder论文总结与关键部分翻译一、论文主要内容总结1. 研究背景与问题大型语言模型(LLMs)在通用语言任务中表现出色,但在特定领域(如生物医学、金融、法律)的适配仍面临挑战:领域自适应预训练(DAPT):需全参数训练,计算成本高,且易导致“灾难性遗忘”(模型通用能力下降)。检索增强生成(RAG):虽无需修改模型参数,但推理时需进行昂贵的近邻搜索,且处理长上下文会引入显著延迟。2. 核心方案:Memory Decoder(MemDec)提出一种即插即用的预训练记忆模块,通过小型Transformer解码器实现高效领域适配,无需修改原始LLM参数,核心设计包括两部分:预训练阶段:让MemDec学习模仿非参数检索器(如kNN-LM)的行为——先构建领域语料的键值数据库,计算kNN检索分布,再通过“分布对齐损失(KL散度)+语言建模损失”的混合目标,将检索知识编码到MemDec参数中。推理阶段:MemDec与基础LLM并行处理输入,通过插值参数α融合两者的输出分布(公式:(p_{Mem-PLM}(y_t|x)=\alpha\cdot p_{Mem}(y_t|x)+(1-\