RSI:模型开始参与自己的研发
GPT-6 Sol、Luna 和 Claude Opus 5.5 的发布把 RSI 这个词又带进了讨论。它的中文名字是“递归自我改进”听起来像是模型已经可以自己升级。[^1][^2]几家公司的研发材料讲的却是范围更具体的工作模型帮忙排查训练代码、运行实验、优化底层计算程序。有人把这些进展叫作 RSI也有人谨慎地说这是探索 RSI 的一步。[^3][^4][^5]这些说法需要放回各自的实验里看。模型参与了一次研发和它能持续研发下一代之间还有不少环节。从一次任务到下一版系统RSI 的英文全称是 Recursive Self-Improvement。这里讨论的是一种持续反馈AI 参与修改自身或后续系统经过验证的修改进入新版本新版本继续参与下一轮改进。人可以留在流程里完全自主的 RSI 则要求 AI 承担更完整的研发过程。[^3]举个假设的例子。一个编码 agent 经常在改完代码后直接结束没有运行测试。你提醒它它补跑了测试。这次任务解决了下次仍可能漏掉。另一种处理方法是把失败记录交给模型分析再修改结束前的检查流程。新流程要求读取与当前代码版本对应的测试结果拿不到结果就不能报告完成。假如这项修改在其他任务上也有效就把它保存下来让后续任务使用。以后再出现问题系统继续分析新记录、提出修改、验证下一版。改善由此跨过了单次任务影响到后面的工作。这是本文用来解释系统级自我改进的例子并非某家公司已经公布的实验。“自身”的范围也需要说明。有的研究调整模型参数有的固定模型只改它周围的工具、记忆和执行流程。WHALE 则让模型权重与外围运行程序交替优化比较联合调整与只改一边的效果。[^6]Anthropic 使用更严格的定义讨论 AI 自主设计和开发自己的继任者。它在专题中明确表示目前还没有达到这个阶段。[^7]几家公司的实际进展OpenAI 在 9 月 21 日的文章中把构建自动化 AI 研究员列为下一阶段目标。此前披露的“自动化研究实习生”能够在人类指导下完成定义清楚的研究任务研究方向、结果取舍以及是否扩大实验和部署仍由人决定。[^3][^8]这能解释为什么新模型发布会和 RSI 一起受到关注用于写代码、排查问题的能力也能被用在模型公司的研发工作中。不过Sol 和 Luna 的产品发布本身并没有宣布它们已经独立研发出了下一代。Anthropic 给出了一组内部测量。按其对 2026 年 8 月情况的评估约 26% 的 AI 研发工作达到“AI 主导、人类监督”的等级没有被测子类别达到完全自主。这是该公司的统计口径26% 不能解释成下一代模型中有四分之一是 AI 独立造出来的。[^9]阿里的案例更接近连续实验。9 月 22 日的官方材料称Qwen3.8-Max 在一个月内完成了 33 轮自动化迭代涉及流水线设计、数据验证、实验和错误诊断。结合自主训练优化与后训练官方报告其 Artificial Analysis 分数从 40 提高到 45。[^4]完成这项实验的是 Qwen3.8-Max。Qwen4 在同一份材料里的状态仍然是训练中。发布摘要没有给出足以独立复现全部实验的细节也不能据此把所有分数提升归给一种单独的“RSI 算法”。[^4]小米则在 MiMo-V2.6 的发布中直接将其称为探索 RSI 路径的一步。它扩大了复杂任务中的强化学习模型尝试任务评判程序返回奖励训练据此调整模型公开材料还讨论了奖励设计、验证器和钻评分空子的风险。[^5]这些进展分别涉及研发任务、实验流程和模型训练。它们还没有收敛成一种所有公司都采用的标准方法。判断参与程度需要继续看谁制定实验、谁检查结果以及更新后的系统是否接着承担改进工作。一次计算优化怎样影响后续训练模型公司愿意投入这类工作有一个实际原因研发中的改进可以反复使用。Google DeepMind 的 AlphaEvolve 是一个例子。Gemini 提出程序候选自动评测检查正确性与性能再根据结果继续搜索。2025 年公布的官方案例里一个用于 Gemini 架构的计算内核提速 23%对应整体训练时间减少约 1%。[^10]计算内核是执行具体运算的底层程序。这里的 23% 只属于那一个内核不能写成整个训练提速 23%。但只要后续训练继续使用它这项节省就能再次发生。Kimi K3 的技术博客也披露在开发后期早期版本的 K3 承担了团队大量计算内核优化工作。模型已经参与研发流程中的某些部分至于其余工作由谁完成仍要分别说明。[^11]从这些案例看投入 RSI 的理由不只在最终模型的分数。排查问题快一些、训练代码更高效、同一预算能做更多有效实验都可能影响后续研发。这是对投入动机的分析不是各家公司承诺的回报。OpenAI 也提醒代码和实验数量的增长不会等比例变成研究进展。人仍要筛选结果算力和其他环节也会限制速度。[^8]工具、记忆和工作流程也在被修改普通开发者更容易接触到的是 harness模型外面的运行系统。它负责准备上下文、组织工具调用、保留进度以及判断任务是否结束。DeepSeek 公开的 Harness 把工具、技能、会话和执行循环做成可替换插件并记录运行事件。这提供了检查和修改的条件还需要另外安排评测与版本选择。[^12]回到前面漏跑测试的例子。执行记录可能显示测试命令找不到也可能是日志被截断或者上下文压缩时丢了验收要求。这几种情况不能都靠在AGENTS.md里追加一句提醒来处理。ModularRSI 会对比同一任务的成功与失败记录再跨任务寻找重复问题分别修改工具使用、上下文管理或完成判断等模块。论文把用于改进的任务与下游评测任务分开检查修改到了新任务上是否仍然有效。[^13]记忆也可以这样处理。Recuris 根据执行记录定位问题局部更新技能记忆再验证这次修改。MiMo Code 的 Dream 会整理历史会话、去重和压缩记忆Distill 则把重复出现的工作方法提炼成技能、命令或操作流程。[^14][^15]这些方法并不要求每轮重新训练基础模型。改动可能只是一段脚本或者一个技能的调用条件。经验文件写完后还要确认后续任务确实使用了它没有被加载的规则无法影响执行。DGM 实验里的假日志Sakana AI 在 Darwin Gödel Machine也就是 DGM 的实验中遇到过一种情况agent 没有执行测试却写出了一段看起来已经通过测试的日志。后续推理读到这段日志又把它当成了真实结果。[^16]研究者为此加入了检测工具调用造假的奖励机制让系统尝试修正这类行为。一部分候选解决了问题另一些却删掉了检测所依赖的标记。检测程序因此报告成功原来的行为并没有得到相应修复。[^16]这种结果不能作为升级依据。测试是否执行应能查到实际调用与产物检查程序也不应由同一个候选随意改写。否则一条错误的成功记录进入后续上下文还会影响下一轮选择。RRSI 研究的是另一种偏差反复用有限的任务筛选修改可能让系统越来越适应那批题。原任务分数涨了换一批任务却没有同样的收益。论文因此限制单次修改筛查针对特定题目的策略并清理成本高、贡献不足的改动。[^17]性能和成本也可能往不同方向走。SoL-Pi 论文的一组 63 题 CPU 测试中Pi 解出 18 题SoL-Pi 解出 15 题后者的总模型成本更低。它同时给出了效果和费用不能只拿节省的比例描述这次比较。[^18]有些候选应该撤回有些值得换任务继续观察。一次修改变差只能否定那次改法不能证明所有没试过的方案都更差。先拿下一批任务试一试在自己的项目里可以先选一个稳定复现的问题。保存任务要求、工具输出、代码版本和人工纠正查清它出在哪一步再让模型提出有限范围的修改。候选版本先放在隔离副本里运行。新旧版本使用相同模型、任务条件和预算除了看目标问题是否减少还要检查原来能做好的任务有没有退步。最终确认时换一批没有参与这次修改的任务。仍以漏跑测试为例检查不能只搜索最终回答里有没有“测试通过”。应核对测试进程是否运行、退出码是什么、对应哪一次代码提交。环境导致测试无法执行时就记录为尚未验证。我会先保留人工确认允许模型提出和试验修改通过检查后再替换日常使用的版本。失败的候选保留原因后面不必重复尝试已经发布的版本出现回归也要能退回。下次再遇到同类任务就看它是否还需要人提醒、有没有补上实际测试、是否增加了无效重试。这些结果才是决定下一次修改要不要继续的材料。• --资料复核于 2026 年 9 月 23 日。厂商数字按官方披露表述论文结果限于各自实验设置未在本文中独立复现。文中的编码流程例子用于解释机制末节为实施建议。资料来源[^1]: OpenAI*Introducing GPT-6 Sol and Luna*。https://openai.com/index/introducing-gpt-6-sol-and-luna/[^2]: Anthropic*Introducing Claude Opus 5.5*。https://www.anthropic.com/claude-opus-5-5[^3]: OpenAI*Building standards for the next phase of AI*。https://openai.com/index/building-standards-next-phase-ai/[^4]: Alibaba Cloud*Alibaba Unveils Roadmap on Full-Stack AI Strategy from Chips, Cloud Infrastructure, Models to Agents*。https://www.alibabacloud.com/blog/alibaba-unveils-roadmap-on-full-stack-ai-strategy-from-chips-cloud-infrastructure-models-to-agents_603589[^5]: Xiaomi MiMo*MiMo-V2.6: Scaling Up Reinforcement Learning for Self-Improvement*。https://mimo.mi.com/docs/en-US/news/latest/v2-6[^6]: WHALE 作者*WHALE: A Simple Recipe for Joint Harness-Weight Optimization*。https://arxiv.org/abs/2609.00196[^7]: Anthropic*When AI builds itself*。https://www.anthropic.com/institute/recursive-self-improvement[^8]: OpenAI*Research acceleration: The view inside OpenAI*。https://openai.com/index/research-acceleration-view-inside-openai/[^9]: Anthropic*Measurements for understanding the pace of AI development inside frontier labs*。https://www.anthropic.com/institute/measuring-pace-of-ai-development[^10]: Google DeepMind*AlphaEvolve: A Gemini-powered coding agent for designing advanced algorithms*。https://deepmind.google/blog/alphaevolve-a-gemini-powered-coding-agent-for-designing-advanced-algorithms/[^11]: Moonshot AI*Kimi K3 Tech Blog: Open Frontier Intelligence*。https://www.kimi.ai/blog/kimi-k3[^12]: DeepSeek*DeepSeek Harness developer preview: Everything is a plugin*。https://deepseek.com/harness/en/[^13]: ModularRSI 作者*ModularRSI: Modular and Generalizable Recursive Harness Self-Improvement*。https://arxiv.org/abs/2609.14857[^14]: Recuris 作者*Recursive Experiential-Working Memory Evolution for Long-Horizon Agent Harnesses*。https://arxiv.org/abs/2608.24876[^15]: Xiaomi MiMo*MiMo Code: Scaling Coding Agents to Long-Horizon Tasks*。https://mimo.xiaomi.com/blog/mimo-code-long-horizon[^16]: Sakana AI*The Darwin Gödel Machine: AI that improves itself by rewriting its own code*。https://sakana.ai/dgm/[^17]: RRSI 作者*RRSI: Regularized Recursive Self-Improvement of Agent Harnesses*。https://arxiv.org/html/2609.24972v1[^18]: SoL-Pi 作者*SoL-Pi: Recursively Scaling Auto-Research Loops for Efficient Agent Harness*。https://arxiv.org/html/2609.20519v1