论文When Can Agents Forget Their Reasoning? ICLR for Long-Horizon Agent Context Compression作者Mingxuan Wang, Fei Luo, Bo Wang, Guorun Yao, Yinglong Guo, Chao Ning, Hongyue Chen, Yanbiao Ma, Jungong HanTierFlow 团队 / 中国人民大学 / 清华大学arXiv: 2609.29875 开篇一个研究员的深夜幻想2026 年的某个深夜你盯着屏幕上那只正在奋战的 AI Agent突然冒出一个有点哲学的问题它刚才想过的那些事现在还记得吗不是那种存在数据库里的记忆——而是它在做第 47 步任务时脑子里闪过的那段推理嗯根据刚才的报错信息我怀疑是依赖版本冲突先检查一下 requirements.txt……这段内心独白在它已经执行完命令、看到结果、推进到第 48 步之后还重要吗如果重要那它的上下文里正堆积着成千上万句这样的独白——每一段都曾经有用每一段都在持续消耗 token、推高成本、稀释注意力。如果不重要那你凭什么确定删掉它们之后Agent 不会在 20 步之后突然忘了初心走回一条错误的岔路也许你会说那就全部保留好了。可当你的账单上写着缓存读取 token 已超预算三倍当你的 Agent 在第 60 步时开始把第 3 步的结论张冠李戴你就明白全保留是一种昂贵的逃避而不是答案。这个看似琐碎的问题正是长时程智能体long-horizon agent研究中最棘手的暗礁之一。而一篇来自 TierFlow 团队与人大、清华的新论文给出了迄今为止最系统、也最违反直觉的回答之一。答案是推理会过期。但过期的时机不取决于推理本身写了什么而取决于推理里那点真正要紧的东西有没有被搬出去。这句话值得放在手边。整篇论文的所有实验、所有理论、所有数字都是它的注脚。 背景Agent 的内心戏膨胀危机先让我们把问题讲清楚。现在的 AI Agent——无论是帮你写代码、做表格、跑安全测试还是浏览网页——本质上都在重复一个循环推理Reasoning→ 行动Action→ 观察Observation→ 再推理。ReAct 范式诞生以来这个循环就是智能体的基本心跳Reflexion 给它加上 verbal reinforcement生成式智能体用它模拟人类社会——万变不离其宗都是想—做—看—再想。问题在于每一次心跳产生的内心戏都会被原封不动地带进下一次心跳。想象一下你请了一位助手修一台复杂的机器。这位助手有个怪癖他把自己说过的每一句话都用录音笔录下来每做一步之前都要把迄今为止的全部录音从头听一遍。第一步听 1 分钟第十步听 10 分钟第 100 步……他一半的时间都在听自己过去的废话。更要命的是磁带堆里还藏着过期情报——第 3 步时他推测故障在电机第 40 步已经证实是电路板问题可那段错误的推测仍然躺在磁带里随时可能干扰他此刻的判断。这就是长时程 Agent 面临的记忆膨胀早期决策早已执行完毕、结果早已观察完毕但它们产出的推理文本仍然赖在上下文里不走。上下文越长推理越贵注意力越涣散——Lost in the Middle的诅咒在几十轮的累积下被放大到荒谬的程度。这甚至不只是成本和注意力的问题过期的推理本身就是一种误导源它让模型沉浸在当时为什么这么做的叙事里而不是现在面对什么的现实里。你可能会说这还不简单压缩啊思维链压缩CoT Compression已经是一个热闹的研究方向了TokenSkip、CONCISE、Step Entropy……各路方法都能在数学题上把推理砍短一半还不掉精度。既然解题的草稿都能删Agent 的内心戏凭什么不能但论文作者敏锐地指出了一个本质区别静态压缩和在线压缩是两种完全不同的手术。静态压缩面对的是一具尸体——一段已经完成的推理链答案是确定的你删完之后只需要验证答案还对不对。全程无反馈、无环境、无后续。而 Agent 场景里你面对的是一条活的生命线在第 t 步删掉一段推理可能改变第 t1 步的工具调用从而改变第 t1 步的观察结果从而改变之后所有的决策分叉。你不是在删减一篇写好的文章你是在蝴蝶的翅膀上动刀——而蝴蝶正飞在风暴中心。更微妙的是信息的位置会流动。一个中间结论、一条约束、一个计划最初可能只存在于推理文本里但随着 Agent 调用工具、写入代码、生成文件、收到环境反馈同样的信息可能被搬运到了外部世界。一份端口扫描计划在被执行之后就变成了工具输出里的真实扫描结果一段数据清洗规则在被写成代码之后就住进了脚本文件里。当信息已经落盘为代码那段孕育它的推理还留着干嘛这就是论文标题里那个问题的真正分量Agent 到底什么时候可以安全地忘掉自己的推理要回答它既需要一套能安全下刀的工程方法也需要一套能解释为什么这把刀落得对的分析框架。这篇论文恰好两样都给了。 ICLR用预测自信度给推理打分论文提出的方法叫ICLRInteraction Aware Compression for Long Horizon Reasoning长时程推理的交互感知压缩。名字有点拗口但机制干净得像一把瑞士军刀——整个方法不需要任何训练只需要一个冻结的打分模型和一条朴素的信息论直觉。核心直觉你说得越笃定越是可以忘回想你自己的生活经验。开会做笔记的时候哪些内容你会随手省略112你不会写王总周五要汇报你会写得清清楚楚。被省略的内容有个共同点你对它们极度确定——要么它们是套话废话要么它们所依赖的信息已经在别处有了更可靠的记录。反过来凡是你心里打鼓的地方——“这个方案有两个风险我还没想清楚”——你一定会记下来因为它的内容无法从其他地方重建。ICLR 把这个生活直觉翻译成了信息论语言预测熵predictive entropy。用一个冻结的代理模型论文里用的是 Qwen3.5 9B对每个推理块以空行分隔的段落做前向计算给定前文模型对这一段里每个 token 的预测有多犹豫预测分布越尖锐低熵说明这段文字越按部就班、越容易被从上下文中重建或替代——删了它等于删了一句正确的废话预测分布越平坦高熵说明这段文字承载了真正的决策不确定性是真信息删了就是真的损失。这个打分是上下文条件化的——打分模型看到的不是孤立的推理段而是完整的系统提示、工具定义、累积的交互历史和当前步骤按因果顺序排列。这一点至关重要同一句现在检查端口 8080在任务初期可能信息量很大在已经跑过三次扫描之后可能就是一句正确的废话。打分必须感知这句话此刻还重要吗而不是这句话在统计学上罕见吗。这个设计让同一个文本块在不同轨迹状态下拿到不同分数——分数不是文本的属性而是文本与状态的关系的属性。手术流程整个在线压缩循环是这样的AgentDeepSeek V4 Flash开启高推理档位完成第 t 步产生推理 R_t、行动 A_t、观察 O_{t1}。ICLR 把 R_t 按双换行边界切成 N 个推理块排除空块打分模型对每个块内所有 token 的预测熵取平均。把熵最低的 ⌊0.8N⌋ 个块替换成字面标记[SKIP]——固定删掉 80% 的低熵块不做任务特定的调参。当只有一块时不动刀。行动、工具调用、工具输出、观察结果一律原样保留一个字不动。压缩后的历史被写回持久化上下文永不恢复。Agent 的下一步请求就是吃这份删减版历史长大的——每一次后续请求都活在被修改过的轨迹上不存在临时压缩、事后还原的侥幸。这一步棋非常讲究压缩策略只允许碰推理永远不许碰已经发生的交互记录。因为行动和观察是任务状态的外部锚点——它们是这个世界的既成事实而推理只是对事实的解读。删事实危险删解读在其信息已被外部化之后却常常是安全的。替换成[SKIP]而不是直接抹除还留下了一个诚实的痕迹模型知道这里曾经有过一段思考只是它不再重要了。有一个细节值得玩味打分模型的输入上限是 42K token一旦超限该步直接跳过压缩而不是截断历史。宁可不删也不破坏 Agent 看到的世界完整性。这种克制在效果优先、过程粗暴的压缩文献里并不常见——很多方法为了保证压缩率不惜截断或改写观察记录而 ICLR 把不碰事实当成了铁律。 主实验删了 80% 的内心戏成绩反而更好了实验平台是WorkBuddyBench一个包含 260 个长时程任务的基准横跨代码80 个、办公50 个、安全60 个、网页70 个四个领域。任务长、交互深、反馈密正是记忆膨胀的天然温床。在全部 260 个任务上ICLR 把平均奖励从0.699 提升到 0.718——同时输入 token 减少25.5%输出 token 减少14.4%缓存读取 token 减少33.3%。总 token 从 269 万降到 219 万下降 18.5%。对局记录 102 胜、76 平、82 负。注意这个结果的形状既省钱又提分。这在上下文管理领域几乎是罕见的姿势。看同一张 Pilot40 对比榜单滑动窗口K5分数暴跌 11.2 分、token 反而暴涨 56%PACE 省了 41.6% 的 token 但掉了 9.1 分CoMem 更夸张token 砍掉 59.5%分数直接跳水 23.3 分大名鼎鼎的 ACM 在满分 100 的尺度下只剩 33.7 分。ICLR 以 70.3 的均分站在分数上升的一侧旁边只有周期性摘要n5勉强同侧但它的 token 是涨的。更戏剧性的数字出现在安全Security领域完整基准上 ICLR 拿到 70.7 分比基线的 47.8 分高出 22.9 分。一个压缩方法在一个领域暴涨近 23 分这暗示了一件比压缩无损更有意思的事——堆积如山的旧推理不仅是成本负担还是活跃的噪声污染。安全任务的轨迹往往布满误导性的报错、曲折的排查路径过期的推理记录着已被证伪的假设持续向模型广播错误的先验。清掉低价值的内心戏Agent 反而看得更清了。这跟人脑的工作方式何其相似工作记忆需要不断清理否则就淹没在无关细节里。消融实验固定 80 个任务代码、办公、安全、网页各 20进一步确认了每个设计选择的贡献ICLR 拿到 0.738基线只有 0.627砍掉打分时的历史上下文Step Only Entropy降到 0.711无差别全删Delete All Thinking是 0.718——仍然比基线高出一截但追不上上下文条件化的熵排序。四种随机删除比例5%–40%全部落在 0.68 附近没有一个摸到熵排序的脚踝。一句话总结推理历史里确实冗余巨大但删哪些比删多少重要得多而何时删的上下文感知又是加分的关键。随机删 40% 不如聪明地删 80%——这个对比本身就值得裱起来挂在每个做 agent 压缩的人的工作台上。 轨迹放大蝴蝶效应的账单接下来是这篇论文最迷人的发现——轨迹放大效应trajectory amplification。直觉上你会认为删掉 10% 的推理 ≈ 省 10% 的输入 token删掉 20% ≈ 省 20%全删 ≈ 省最多。线性、单调、无聊。实验数据说不。看这组数字随机删除10%的推理 token总输入居然下降了60.5%而随机删除20%输入只下降44.0%——删得更多省得更少。全删推理的输入下降 63.6%也并没有比删 10% 多出多少。对局数量也被搅动不同的干预方式产生的 agent 调用次数差异巨大有的干预让 Agent 提前收工有的却逼得它反复试错、重新推理把省下的 token 加倍奉还。这就像你在高速公路上拐了一个 1 度的小弯最后却开到了另一座城市。局部的小改动通过工具选择、观察结果、重新推理、错误恢复、提前或延迟终止这些环节被逐级放大最终整条轨迹的总算力账单变得面目全非。删 10% 的那组之所以省得异常多可能是因为删得恰好——既削掉了冗余又没伤到决策主干Agent 一路顺畅走完而删 20% 的那组可能恰好砍掉了一块当时看着啰嗦、后来救命的推理Agent 一步踏空后面全靠额外的探索来补洞。省与费不在删的那一刻决定在整条轨迹的回声里决定。论文在附录里给这个现象配了一份严格的理论账本。Proposition B.5轨迹级 token 分解说得很直白整条轨迹的 token 差异 前 K* 步的逐步差异之和 压缩轨迹多出来的请求 基线轨迹多出来的请求。也就是说总账不只记你删了几个 token还记你的删法让 Agent 后来多走了几步或少走了几步。Theorem B.3有限时程轨迹扰动更进一步如果每步行动分布的总变差都被 ε_t 界定那么整条轨迹分布的总变差以 1−∏(1−ε_t) 为界期望分数差不超过 min{1, Σε_t}。每一步的小偏移会跨步骤累积成一个谁也没法假装看不见的轨迹级扰动。这个发现对整个 agent 压缩研究都是一记警钟只看删了多少 token评估压缩方法就像只按页数评价一本书。两个删了同样多 token 的方法可能一个让 Agent 多绕了三小时的弯路一个让它直奔终点。评估压缩必须看整条轨迹的账——这也正是 ICLR 选择在线压缩而非事后压缩作为默认设定的原因只有真正活在交互回路里的压缩才能暴露出轨迹放大这种系统性效应。️ 外部化差距推理的保质期藏在信息的位置里方法有效、效应迷人但论文真正想回答的什么时候能忘还需要往 Agent 的脑子里看。作者用了三套互补的手段表示探测、激活修补、受控轨迹干预。它们共同指向一个核心概念——外部化差距internalization and externalization gap同一段推理的价值在它携带的信息只住在脑子里和已经搬进世界这两种状态下有断崖式的差异。你的脑子里藏着还会想起来的信号第一套实验是未来必要性探测future necessity probing。思路是在每次压缩边界从冻结模型的隐状态里训练一个线性探针预测之后的轨迹里会不会发生重新推导、补充推理或显式重规划。这等于问模型一个关于未来的问题你现在消化掉的这段上下文稍后还会不会被你想起来在 31 个任务、265 个压缩边界样本上112 个正样本严格按任务级嵌套划分训练/测试——探针的层选择、池化方式、标准化、PCA 全部只在训练任务上完成外圈评估用的是从未见过的任务——探针拿到了AUROC 0.844、AP 0.811、平衡准确率 0.760。这意味着什么Agent 当前的内部表示里提前编码了这段推理稍后还会被需要的信号——在这个信号尚未变成行动之前它就潜伏在表示之中。推理的未来价值不是玄学是可测量的、可泛化到新任务的。所有外层折叠里都选中了提示词最后一个 token 的表示说明这个边界位置是整段上下文的摘要锚点。被删除的推理真的在预测中留下了洞第二套实验是激活修补activation patching方法学源自 ROME 那类定位事实关联的工作。把有完整历史和历史推理被删两种条件下、提示词边界的残差表示做替换看下一 token 分布能恢复多少用 KL Repair 度量1 表示完全修复0 表示毫无作用。结果像一部层层解谜的电影第 4 层修补只能恢复 0.047近乎无效——浅层几乎不在乎那段被删的推理第 20 层恢复到 0.459第 28 层 0.724到了第 31 层——最深的层——KL Repair 达到 0.978几乎完全修复top-1 预测完全对齐。信息加工是分层的深层把历史推理的影响实实在在地编码进了表示删除历史造成的扰动是真实的、可定位的同时它也证明了这段历史的信息是可恢复的——在表征层面上想过这件事留下了可以被打捞的痕迹。这套证据链把推理确实携带着后续决策需要的东西从行为观察推进到了机制层面。关键一刀信息搬家之后旧推理就成了装饰品第三套也是最直白的一套外部化分析。作者在每个压缩边界人工标注一个指标 G_i——“任务特定的派生状态”中间计划、约束、实体关系、综合结论不包括任务指令原文和原始观察是否还只存在于推理里。如果这些信息已经写进了代码、文件、工具输出或环境反馈就记为已外部化。结果像一道闪电劈开了整个问题派生状态只在推理里时未来行为风险率67.3%派生状态已外部化后风险率骤降到36.2%。同一个任务内部这个差距是 19.8 个百分点对应的隐藏分数差 0.283。推理的保质期不由它写下的那一刻决定而由它携带的信息何时搬家决定。这是全篇论文最具实践指导意义的一个数字——它几乎就是一条可操作的遗忘准则盯住派生状态的栖身之处而不是盯着推理文本本身。受控干预把这个结论钉死在案板上。作者构造了固定中间状态的续跑实验只改推理、不动周围任务状态只保留最新推理 → 规则分数0.872与保留全部历史持平只删掉最新推理 → 掉到0.760删掉所有推理 → 只剩0.675。最新推理是黄金陈旧推理是旧报纸——除非旧报纸里还夹着没取出来的现金。位置比总量重要这个结论与工作记忆的最新项最重要的认知直觉严丝合缝。最漂亮的证据是这一条当相关代码已经写入磁盘后清掉后续的推理规则分数纹丝不动——0.759一个点都不掉。推理完成了它的历史使命它孕育的代码已经替它永远地活在了外部世界里。附录 Corollary B.4 给这一切封了顶只要外部化状态在每一步都足以让压缩前后两个策略产生相同的行动分布那么两条轨迹的分布完全相同——遗忘是无损的而且这不是修辞是有证明的充分条件。环境反馈的实验则补上了循环的最后一环当 Agent 已经观察到的 stderr 报错仍可见时它直奔修复Edit把同样的报错藏起来Agent 就会再发一次 Bash 命令亲自把同一个错误再犯一遍、再观察一遍——环境反馈本身就是一种外部信息载体Agent 丢了它会本能地回到世界里重新获取。这个小小的行为细节特别生动它说明 Agent 的聪明很大程度上是对外部状态的精明索引一旦索引失效它宁愿重新采样世界也不凭空脑补。 哲学时刻推理不是历史是工作状态现在我们抵达这篇论文真正的思想腹地。在传统观念里推理是思考的历史记录——像航海日志发生了就值得存档删改即篡改历史。这篇论文用一整套证据逼我们换一种看法Agent 的推理更像是一块动态的工作状态dynamic working state——像一块草稿板它的价值随时间衰减随外部化而蒸发随新观察的出现而贬值或升值。同一段推理在轨迹的不同位置上身份完全不同孕育期它是产床执行期它是蓝图完成后它是纪念碑——而纪念碑的功能主要靠那里曾经发生过什么来满足而不是靠反复诵读碑文。这个视角转换影响深远。如果推理是历史那默认该保留删除需要理由。如果推理是工作状态那默认该清理保留才需要理由——而保留的理由只有一个它携带的任务派生状态还没有可靠的外部栖身之所。这个原则一旦确立agent 上下文管理的设计空间就被彻底重排了问题从怎么压缩得更狠变成怎么更早、更可靠地把派生状态外部化——写代码、落文件、调工具这些行为本身就是最好的压缩策略。遗忘的许可证是外部化签发的。这不只是工程智慧它甚至呼应了认知科学里关于人类工作记忆的经典图景。人类思考时也一样我们把中间结果写在纸上、贴便签、敲进计算器然后心安理得地让那段心算从意识里退场——外部化是人类遗忘的前提也应当是 Agent 遗忘的许可证。延展心智extended mind假说认为认知不止发生在颅骨之内笔记本和计算器都是认知过程的一部分这篇论文某种程度上为 Agent 版本的延展心智提供了工程注脚上下文窗口不是 Agent 的全部心智代码、文件、工具输出和环境反馈共同构成了它的外延大脑。还有一个更实用的推论藏在里面最好的压缩策略可能根本不在压缩算法里而在 Agent 的行为习惯里。一个懂得及时把结论写进文件、把计划落成代码、把中间结果交给工具的 Agent天然就拥有了更多可以遗忘的时刻。反过来一个只会闷头推理、从不把想法外部化的 Agent它的每一段历史推理都可能是唯一的救命稻草怎么删都是冒险。这给了上下文管理研究一个新方向的暗示与其事后绞尽脑汁决定删什么不如事前引导 Agent 多用外部世界做草稿纸。遗忘的自由是行动挣来的。论文的理论部分还给了我们一把更锋利的尺子。Lemma B.1残余信息界说一个推理块关于下游目标的残余信息贡献不超过它在给定前文下的条件熵。低熵块的信息贡献天然受限——这就是为什么低熵优先删除在信息论上有底气它不是经验拍脑袋而是有上界担保的。Theorem B.2 把结论推广到多块联合删除的情形。而 Theorem B.3 的轨迹扰动界又提醒我们这把尺子量的是单步账单却开在全程。理论与实验在这里闭环方法为什么有效低熵→低残余信息、风险在哪里局部扰动轨迹级放大、什么时候无风险外部化充分条件三条线各就各位。当然这篇论文不是终点。压缩比例 0.8 是固定的没有做自适应调度——熵阈值能否随任务阶段动态调整探测到的未来必要性信号能否直接反馈给压缩策略形成预测到会被重用就保留的闭环跨任务迁移时外部化边界的标注能否自动化而非人工判定派生状态的定义目前依赖人工判断能否用可计算的信息量指标替代另外本工作在 WorkBuddyBench 上验证基座模型是 DeepSeek V4 Flash结论能否迁移到其他模型家族、更开放的任务分布、更长的真实生产轨迹都值得继续观察。作者把这些留白诚实地摆在了台面上这本身就是好的研究品味。 尾声回到那个深夜的问题它还记得自己想过什么吗现在我们可以回答它不需要记得所有。它只需要在那些信息还没有第二条命的时候紧紧地抱住它们一旦信息在代码里、在文件里、在环境的回声里获得了永生那段孕育它们的推理就可以放心地死去了。遗忘不是缺陷是智能体成熟的标志。就像论文那句平静的结论Agent 的推理是一种动态的工作状态其价值在交互中不断变化——而不是一份需要永远供奉的交互历史。金鱼的记忆只有七秒人们嘲笑它。但也许问题从来不在遗忘本身而在于——你忘了之后世界里还有没有东西替你想着。有就可以忘。这篇论文把这句话写成了数学。 参考文献Mingxuan Wang, Fei Luo, Bo Wang, Guorun Yao, Yinglong Guo, Chao Ning, Hongyue Chen, Yanbiao Ma, Jungong Han. “When Can Agents Forget Their Reasoning? ICLR for Long-Horizon Agent Context Compression.” arXiv:2609.29875, 2026. https://arxiv.org/abs/2609.29875Zeju Li, Jianyuan Zhong, Ziyang Zheng, Xiangyu Wen, Zhijian Xu, Yingying Cheng, Fan Zhang, Qiang Xu. “Making Slow Thinking Faster: Compressing LLM Chain-of-Thought via Step Entropy.” ICLR 2026.Step EntropyICLR 熵打分思想的来源Shunyu Yao, Jeffrey Zhao, Dian Yu, Nan Du, Izhak Shafran, Karthik Narasimhan, Yuan Cao. “ReAct: Synergizing Reasoning and Acting in Language Models.” arXiv:2210.03629, 2022.Jason Wei, Xuezhi Wang, Dale Schuurmans, Maarten Bosma, Fei Xia, Ed Chi, Quoc V Le, Denny Zhou. “Chain-of-Thought Prompting Elicits Reasoning in Large Language Models.” NeurIPS 2022.Nelson F. Liu, Kevin Lin, John Hewitt, Ashwin Paranjape, Michele Bevilacqua, Fabio Petroni, Percy Liang. “Lost in the Middle: How Language Models Use Long Contexts.” TACL 2024.Charles Packer, Sarah Wooders, Kevin Lin, Vivian Fang, Shishir G Patil, Ion Stoica, Joseph E Gonzalez. “MemGPT: Towards LLMs as Operating Systems.” arXiv:2310.08560, 2023.Kevin Meng, David Bau, Alex Andonian, Yonatan Belinkov. “Locating and Editing Factual Associations in GPT.” NeurIPS 2022.激活修补方法来源#论文 #arXiv #AI
