智能体编辑世界模型——重新思考大语言模型智能体的世界建模范式arXiv编号:arXiv:2609.28416v1 [cs.CL]摘要大语言模型驱动的智能体已经可以在多样化环境中处理长视界任务。现有的语言世界模型大多预测环境观测结果;但当可以获取真实工具反馈时,重建高熵、强执行依赖的工具返回响应收益十分有限。与此同时智能体会遭遇任务状态污染(task‑state contamination):无依据的假设、过时的计划残留在交互历史中,扭曲后续全部决策。本文提出A(\mathcal E)W(\mathcal M)(Agent‑(\mathcal E)diting World (\mathcal M)odel,智能体编辑世界模型),不再模拟工具返回观测,转而建模推理与动作如何塑造后续任务进展。A(\mathcal E)W(\mathcal M)包含两大核心模块:Action Judge动作判别器,将决策划分为关键(CRITICAL)、探索((\mathcal E)XPLORATORY)、噪声(NOISY)三类;State Revision状态修订模块,基于已有观测历史,编辑噪声类的推理‑动作接续片段。(\mathcal E)ditAct将上述能力和真实执行流程深度集成:直接修改后续决策所依赖的底层状态,而不是仅仅输出批评意见。本文在搜索、终端、软件工程三大领域,通过中期预训练与有监督微调完成A(\mathcal E)W(\mathcal M)训练。在自建Action Judge评测基准上,A(\mathcal E)W(\mathcal M)取得70.5%宏F1,相比最强前沿基线高出10.6个百分点。在6项评测基准、3套智能体基座上,(\mathcal E)ditAct相比最优基线平均提升3.2‑6.7分。进一步,基于经过验证的(\mathcal E)ditAct轨迹做拒绝采样微调,得到A(\mathcal E)W(\mathcal M)‑RFT;推理阶段不再依赖在线A(\mathcal E)W(\mathcal M)指导,在三个领域相比Self‑RFT提升2.2‑2.6分。关键词大语言模型智能体;世界模型;状态编辑;长视界任务;任务状态污染;拒绝采样微调目录引言A(\mathcal E)W(\mathcal M)智能体编辑世界模型2.1 符号前置定义2.2 智能体状态建模与状态编辑2.3 (\mathcal E)ditAct:状态编辑与真实执行集成推理流程模型学习与能力内化3.1 数据集构造3.2 两阶段训练流程3.3 A(\mathcal E)W(\mathcal M)‑RFT:拒绝采样微调迁移能力实验4.1 实验设置4.1.1 评测基准4.1.2 基线对比4.1.3 模型基座4.2 Action Judge判别任务结果4.3 (\mathcal E)ditAct端到端智能体主实验4.4 A(\mathcal E)W(\mathcal M)‑RFT离线迁移实验4.5 消融实验任务状态污染案例分析讨论与局限性结论参考文献附录A 数据构造细节附录B 完整超参数与训练脚本附录C 补充实验结果1 引言世界模型被视作通用智能的基础,用于捕获环境结构与动力学,支撑理解、推理与规划。具身AI、视觉交互视频生成领域的大量工作验证了世界模型价值。对于长视界大模型智能体,世界模型帮助智能体理解任务环境,维持连贯决策。传统世界模型遵循以环境为中心的优化目标:根据动作预测下一个状态/观测。该范式适合具身物理仿真、视频生成。但很多语言智能体场景下,工具返回观测具备高熵、强执行依赖:网页搜索结果受网页内容与排序动态变化;终端输出、单元测试结果依赖文件系统与运行时状态。当可以调用真实工具拿到真实反馈,去预测这些观测的收益有限;仿真生成的虚假观测甚至会误导智能体后续推理。本文轨迹分析发现一类高频失败根源:任务状态污染。智能体在陌生环境探索时,会维护假设、计划、对已取得进展的判断。智能体容易把未证实的假设当成事实、即便收到矛盾反馈依旧保留过时计划、误将局部进展当作任务完成。这些错误会残留在交互历史中,通过每一步局部看似合理的动作持续放大恶化;即便存在真实环境观测,也不会自动修正智能体内部的理解与假设。传统世界模型目标:预测环境观测;A(\mathcal E)W(\mathcal M)目标:建模智能体自身推理、动作会如何影响后续任务进展,对污染的推理‑动作片段直接做编辑修改,而不是预测环境输出。A(\mathcal E)W(\mathcal M)由两大模块构成:Action Judge动作判别器:接收执行前完整状态,将待执行推理‑动作对标记为三类:CRITICAL关键:缩小核心信息缺口、获取必需证据、完成关键状态变更;\(\mathcal E\)XPLORATORY探索:有效降低不确定性、测试可行分支;NOISY噪声:几乎不推进任务,带来重复、无关、约束违背、错误方向。State Revision状态修订模块:针对被判定为噪声的片段,生成修订后的推理与动作,修正错误假设、更新计划。(\mathcal E)ditAct推理流程:智能体原始输出推理‑动作对,A(\mathcal E)W(\mathcal M)做判别;仅噪声片段会被替换为修订版本;将处理后的推理动作送入真实环境执行;编辑后的内容会进入后续交互历史,直接改变后续全部决策依赖的状态,而不是仅仅输出一段批评文本。训练分为两阶段:中期预训练(52B交互token),接着在120K条高质量样例做有监督微调SFT。进一步收集(\mathcal E)ditAct运行轨迹,做拒绝采样微调得到A(\mathcal E)W(\mathcal M)‑RFT,推理阶段不再需要A(\mathcal E)W(\mathcal M)在线介入,把编辑带来的能力直接内化进智能体基座。本文核心贡献提出A(\mathcal E)W(\mathcal M)智能体编辑世界模型,摒弃预测环境观测的传统范式,转而建模决策带来的任务进展,直接编辑智能体内部状态,缓解长视界交互过程的任务状态污染;提出(\mathcal E)ditAct推理流程,执行前选择性替换噪声推理‑动作接续片段。构建跨域训练流水线,通过轨迹合成得到Action Judge与State Revision训练数据;构建3000条决策级Action Judge评测基准;提出A(\mathcal E)W(\mathcal M)‑RFT,利用(\mathcal E)ditAct真实轨迹,把编辑能力离线迁移进普通智能体。在搜索、终端、软件工程三大领域验证有效性:Action Judge任务宏F1达到70.5%,高出最强基线10.6个点;(\mathcal E)ditAct在6项基准、3个基座上平均提升3.2‑6.7分;A(\mathcal E)W(\mathcal M)‑RFT离线模式相比Self‑RFT提升2.2‑2.6分。消融实验证明:直接替换推理‑动作片段,效果优于单纯重采样、提示批判。2 智能体编辑世界模型2.1 符号前置定义任务x xx;t tt步之前交互历史:h t = ( x , ( r i , a i , o i ) i = 0 t − 1 ) h_{t}=\big(x,(r_i,a_i,o_i)_{i=0}^{t-1}\big)ht=(x,(ri,ai,oi)i=0t−1)r i r_i
