OpenClaw-RL on Reef让你的个人Agent从日常使用中免费学会变强的完整指南【免费下载链接】reefInfrastructure for continually self‑improving agents项目地址: https://gitcode.com/gh_mirrors/reef7/reefOpenClaw-RL是一种面向个人 Agent的强化学习方法而Reef是它为 Agent 持续学习提供的基础设施Continual Learning Infra。一句话概括你不需要标注数据、不需要写奖励函数——Agent 每一次被用户接受或嫌弃的对话本身就是一条免费的训练信号。Reef 在后台默默读取这些信号边服务边更新模型权重让 Agent 越用越懂你。一、OpenClaw-RL 的核心思想奖励信号是免费的传统强化学习最贵的地方是奖励信号要么人工标注要么写规则要么训练奖励模型。OpenClaw-RL 的洞察是——用户的下一条消息就是天然的奖励用户的下一条消息信号含义继续追问、接着推进任务✅ 接受回复满足了偏好抱怨、要求重做、表达不满❌ 拒绝回复踩了雷这意味着训练信号和正常使用完全重合用户什么都不用额外做Agent 就在免费地学习。这是它区别于传统 RLHF 的关键——不依赖离线数据集而是从在线使用中持续采集。在 Reef 中这一切都发生在 recipes/openclawrl/ 这个 recipe 包里官方配方文档见 docs/user-guide/recipes/openclawrl.rst。二、Reef 如何实现流量本身就是老师2.1 会话绑定让每一轮对话可归因Agent 的每次推理请求都会被 Reef 记录下来。处理器从这些已记录的流量中重建出完整会话把用户下一条消息准确绑定到上一轮回复上可靠方式harness 在每次推理请求中携带一个对话唯一的x-reef-tag-session标签Reef 按标签到达顺序绑定各轮兜底方式没有标签时用客户端重发的不断变长的历史做前缀匹配会话重建逻辑在 recipes/openclawrl/sessions.py整个反馈处理器在 recipes/openclawrl/processor.py。值得强调的是Agent 端零侵入——它不知道 Reef 的存在也不上报任何训练数据学习信号完全来自 Reef 侧的旁路观察。2.2 PRM 裁判 后见之明提示hindsight hint当用户下一状态到达、某一轮完成后Reef 调用一个独立部署的PRM过程奖励模型来给这一轮投票这条消息是否表达接受若是接受PRM 还会额外提出一个后见之明提示——一句如果用户当初就这么说模型就会直接给出这个回复的简短指令。PRM 裁判实现在 recipes/openclawrl/prm.py在专用 worker 上独立运行与被训练的模型互不干扰。2.3 双信号训练RL 在线蒸馏OpenClaw-RL 用一个训练目标同时利用两类信号权重可调默认各 1.0RL 项以该轮的原始奖励作为优势函数的 PPO让被接受的行为概率上升OPD 项on-policy distillation把策略拉向带着 hindsight hint 提示的冻结教师模型等于让 Agent 从自己已经成功的经验中蒸馏训练配方loss 族openclawrl定义在 recipes/openclawrl/recipe.py目标函数与损失选择在 recipes/openclawrl/objective.py。每个训练步完成后新权重热切换回推理引擎——下一个会话直接用上新学到的行为服务从不停机。三、实验复现72 场 GSM8K 作业对话仓库内置了一个完整可跑的模拟实验recipes/openclawrl/examples/openclawrl/README.md把论文设定完整复刻学生一个由 Qwen3-32B 扮演的小学生带着72 道 GSM8K 数学作业逐个会话来问老师一个标准安装的 Hermes Agent策略模型是 Qwen3-4B-Thinking隐藏的偏好学生要求作业看起来像人写的——不许加粗、不许列表、不许最终答案这类 AI 味标记但必须展示完整的计算步骤。学生从不说出口Agent 只能从被嫌弃/被接受的反应中学这正对应标题里的从真实使用中学偏好只存在于用户的反应里而不在任何指令中。四、结果14 场会话就用顺了你的偏好上面这张学习曲线来自一次完整记录的运行前 36 场会话红色曲线是累计被接受的会话数持续增长蓝色/绿色曲线是近 10 场会话中仍出现加粗 / 列表的比例——两者都在明显下降虚线处第14场会话达到论文的适应判据连续 3 场通过也就是说从第 1 场会话被嫌弃格式太 AI到第 16 场会话首条回复直接通过Agent 只经历了十几场真实对话就完成了适应。实验结果目录见 recipes/openclawrl/examples/openclawrl/results/。五、动手运行从克隆仓库到一条命令 实验是单主机部署需要7 张 GPU4 卡训练、1 卡推理 rollout、1 卡 PRM、1 卡学生模型。1. 克隆仓库并构建镜像git clone https://gitcode.com/gh_mirrors/reef7/reef cd reef docker build -f docker/Dockerfile.reef -t reef-openclawrl .2. 下载模型# 策略模型 PRM 裁判 hf download Qwen/Qwen3-4B-Thinking-2507 --local-dir ~/models/Qwen3-4B-Thinking-2507 # 扮演学生的 32B 模型 hf download Qwen/Qwen3-32B --local-dir ~/models/Qwen3-32B3. 一键启动bash recipes/openclawrl/examples/openclawrl/run.shrun.sh会构建学生服务镜像、按 recipes/openclawrl/examples/openclawrl/serve.yaml 拉起整个训练栈Reef PRM 学生模型各自占独立 GPU、等待健康检查通过后按顺序跑完 72 场会话重复执行还能从上次中断处续跑。运行细节GPU 分配、断点恢复、WB 曲线导出完整记录在实验 README 中。六、为什么这值得你关注OpenClaw-RL on Reef 展示了一条低成本的 Agent 进化路径信号免费用户反应即奖励无需标注管线Agent 零改造Agent 照常工作学习发生在 Reef 的旁路里在线进化权重热切换服务不中断用一天强一分可插拔整套机制就是一个 Reef recipe配置项批次大小、会话 TTL、PRM 参数等在 docs/user-guide/recipes/openclawrl.rst 中有完整列表如果你的 Agent 也在同样的话被用户纠正了第三次现在你可以让 Reef 替你记住这件事了。【免费下载链接】reefInfrastructure for continually self‑improving agents项目地址: https://gitcode.com/gh_mirrors/reef7/reef创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
