自改进引擎学习循环的五步飞轮为什么 Hermes 能越用越好用秘密就在这个闭环里引子一个真实的故事2026年3月一位开发者分享了他的使用体验“第一周Hermes帮我做代码巡检每次都要我手动指出哪些问题该关注、哪些该忽略。第二周它开始自动过滤掉我之前标记为’不重要’的警告。第三周它甚至主动建议了一个我之前没想到的检查维度。到了第四周我几乎不需要再纠正它了——它已经’学会’了我的巡检偏好。”这不是魔法而是 Hermes学习循环Learning Loop的实际运作效果。传统 AI Agent 做完任务就结束了——你纠正了它的错误下次新对话它可能犯同样的错。Hermes 做完任务后会自动复盘、自动沉淀经验、自动改进后续行为——你纠正一次它永远记住。学习循环的核心逻辑学习循环可以概括为五个环节形成一条连续链路记忆策划 → Skill创建 → Skill改进 → 检索召回 → 用户建模 ↑ │ └──────────────────────────────────────────────┘ 闭环这五步不是并列功能而是前后依赖的闭环。每一步的输出是下一步的输入最后一步的输出又回到第一步——形成持续运转的飞轮。用一个真实场景理解五步闭环假设你让 Hermes 帮你做每日代码巡检。第一轮冷启动步骤1记忆策划Hermes 没有相关记忆从零开始执行巡检任务。它检查了所有代码变更生成了一个包含50个问题的报告。步骤2Skill 创建你指出其中30个问题是lint警告我不关心lint。Hermes 识别到这个反馈有复用价值自动创建了一个 Skill 草稿daily_code_review其中包含规则过滤lint警告。步骤3Skill 改进你进一步指出还有5个问题是测试覆盖率下降这个我关心。Hermes 把这个偏好写入 Skill更新规则为过滤lint警告但关注测试覆盖率变化。步骤4检索召回下次巡检时Hermes 自动检索到daily_code_reviewSkill按规则过滤和排序问题。步骤5用户建模Hermes 从多轮交互中提炼出你的偏好模型“这个用户重视测试质量和安全性不关心代码风格细节。”第二轮飞轮开始转动记忆策划Hermes 已经有了你的偏好模型主动过滤掉 lint 警告重点关注测试和安全性问题。报告从50个问题缩减到15个。Skill 创建你指出安全漏洞的优先级应该高于测试覆盖率。Hermes 更新 Skill增加优先级排序规则。Skill 改进Skill 从过滤关注升级为过滤关注优先级排序。检索召回下次巡检报告不仅更精准还自动按优先级排序。用户建模偏好模型进一步细化“安全 测试 性能 风格”。第三轮飞轮加速到了第三轮你几乎不需要再纠正 Hermes 了。它已经学会了你的巡检偏好自动按你的标准过滤、排序、推送报告。你只需要偶尔微调一下——比如新增一个关注维度——Hermes 会自动把这个微调写入 Skill 和偏好模型。这就是学习循环的威力不是每次从零开始而是每次从上次的经验开始。飞轮越转越快你的投入越来越少系统的输出越来越精准。五个环节拆解环节一记忆策划——不是全量记录而是精准提炼传统 AI 的记忆策略有两种极端全量记录把所有对话塞进上下文窗口窗口满了就截断。就像把每天的每一句话都记进日记——信息量大噪音也大。短期记忆只保留当前对话的上下文新对话从零开始。就像每次开会都假装第一次来——效率极低。Hermes 的记忆策划走的是第三条路精准提炼。原始对话大量信息 │ 记忆策划筛选提炼结构化 ├── 关键决策 → 写入持久记忆 ├── 可复用方法 → 写入 Skill ├── 用户偏好 → 写入用户模型 └── 噪音信息 → 丢弃核心原则降低噪音保留可复用信号。它像一个聪明的编辑——不是把所有素材都放进最终稿件而是只选最有价值的部分。环节二Skill 创建——从经验到方法的自动化当 Hermes 识别到某个反馈或操作模式有复用价值时它会自动创建一个 Skill 草稿。创建条件同一个问题被纠正 2 次以上用户明确说每次都这样做某操作模式在 3 次以上对话中出现Skill 是可执行的方法论。不是一段代码而是一份结构化的操作指南告诉 AI在什么场景下、按什么步骤、用哪些工具完成什么任务。环节三Skill 改进——持续优化的能力Skill 不是一次创建就固定不变的。Hermes 会在每次使用后评估效果自动优化新增规则用户的新偏好调整优先级用户显示出的偏好排序删除规则不再适用的旧规则合并 Skill相关 Skill 自动合并环节四检索召回——精准匹配上下文当 Hermes 面对新任务时它会自动检索最相关的 Skill 和记忆。检索策略语义匹配基于语义相似度找到最相关的 Skill场景匹配基于当前任务的上下文特征时效性加权近期使用的 Skill 权重更高环节五用户建模——从偏好到人格这是最智能的一步。Hermes 不仅记住你做了什么还提炼出你是什么样的人。用户建模的输出包含偏好画像你喜欢什么风格、关注什么维度决策模式你做决策时通常考虑哪些因素知识边界你擅长什么、不擅长什么沟通习惯你喜欢详细还是简洁、正式还是随意飞轮效应从量变到质变学习循环的真正价值在于时间的复利时间飞轮状态你的投入系统输出质量第1周冷启动高频繁纠正一般第2周起步中少量微调良好第3周加速低偶尔检查优秀第4周稳定极低很少干预卓越使用时间越长你的投入越少系统的表现越好。这是 Hermes 区别于所有其他 Agent 的核心差异。写在最后学习循环是 Hermes 的灵魂。没有它Hermes 就是一个普通的 Agent 框架有了它Hermes 变成了一个能持续进化的 AI 伙伴。但学习循环离不开两个关键支撑——记忆架构和Skill 系统。下一篇我们深入记忆架构看看 Hermes 如何用三层记忆实现从金鱼到老友的进化。关注「AI拉呱」一起探索 AI 技术的前沿落地。本文是《Hermes Agent 从入门到精通》系列第4篇。
