VibeSkills 实战案例深度解析从 195 个技能中精选 7 个17 项验收全部通过的机器学习实验全流程【免费下载链接】Vibe-SkillsIntelligent Skill routing and workflow orchestration for AI agents — 21.12 pp reward, −29.6% tokens on SkillsBench with DeepSeekV4Flash-VE.项目地址: https://gitcode.com/gh_mirrors/vi/Vibe-SkillsVibeSkills 是面向 AI Agent 的智能技能路由与工作流编排引擎它帮你从成百上千个已安装的 Skills 中自动发现、筛选并分配给任务的每个模块。本文通过项目内置的一个真实机器学习实验案例完整还原从 195 个候选技能中精选 7 个 → 拆成 5 个工作组、10 个工作单元执行 → 17 项验收检查全部通过的全过程帮你快速理解技能路由与编排到底怎么工作。一、技能路由解决了什么问题SkillsBench 上的实测数据很多用户装完 AI Agent 之后都会遇到同一个问题装了上百个 Skills想不起来自己装过什么、更不知道该让哪个 Skills 干活。一旦任务变复杂涉及数据、建模、统计、写作多个领域人工规划每个模块用哪个技能几乎不现实。VibeSkills 的思路是把技能调度这件事交给编排引擎发现扫描本机所有技能目录盘点候选 Skills选择读取相关SKILL.md只挑选与任务匹配的少数技能编排把任务拆成模块和工作单元每个模块绑定专属技能owner / verifier 分工验收执行结束后对产物做自动一致性检查全部通过才允许宣告完成。效果有量化数据支撑。VibeSkills 把 SkillsBench 基准改造成更接近生产环境的测试——每题都全局安装 195 个专业 Skill考验 Agent 能否从大量技能中自主发现并组织合适的能力。在 DeepSeekV4Flash-VE 上相比无 VibeSkills 的基线组平均任务得分 21.12 个百分点Token 消耗 −29.6%工具调用 −33.1%。二、案例任务一项从数据到交付的可复现机器学习实验仓库内置的实战案例docs/cases/ml-experiment/要求使用公开数据完成一个可复现的分类实验并交付数据审计、统计复核、4 张结果图、科学报告、7 页组会 Slides。具体设定项目内容数据集威斯康星乳腺癌Wisconsin Breast Cancer569 行 × 30 特征运行环境独立 Python 3.12.12 虚拟环境锁定 18 个依赖版本模型随机基线Dummy 缩放逻辑回归固定种子、防泄漏流水线划分训练/留集 455/114 分层切分训练集上 5 折 × 10 重复交叉验证共 50 折复现一条reproduce.ps1命令重跑第二次运行结果摘要与首次完全一致数据审计阶段由exploratory-data-analysis技能完成核对快照与加载器一致、缺失/非有限值/重复行均为 0、正负样本约 357:212并明确区分事实与建议。三、从候选技能中精选 7 个每个模块谁干活发布准备时VibeSkills 在候选目录中盘点到 100 多个 SkillsSkillsBench 生产化场景则是全局 195 个逐个读取SKILL.md后只选出 7 个其余一律不分配——选得少责任才清晰。完整名单见 selected-skills.json技能角色负责的工作exploratory-data-analysisOwner数据物化 结构/质量/平衡/泄漏风险审计scikit-learnOwner基线实验、指标保存与精确复现验证statistical-analysisOwner不确定性区间计算与假设披露scientific-critical-thinkingVerifier复核偏差、泄漏、声明边界不改他人产物scientific-visualizationOwner4 张 PNG 图 4 份 SVG 导出与视觉 QAsciwriteOwner报告五轮写作审查不改科学内容presentationsOwner7 页 PPTX 制作、逐页渲染与 QA环境搭建、报告初稿、案例打包这 3 个模块不依赖领域技能由 Agent 直接执行。这种技能只出现在真正需要的模块上的分配方式正是 VibeSkills 编排策略的核心。仓库中可浏览相关技能源文件例如 bundled/skills/scikit-learn/、bundled/skills/statistical-analysis/。四、5 个工作组 × 10 个工作单元全流程怎么跑起来整个实验按L级计划顺序推进9 个模块组织成 5 个工作组、10 个工作单元完整定义见 module-work-plan.jsonG1 环境与数据建环境 → 数据审计G2 建模与复现基线实验 精确重放校验G3 统计与科学复核不确定性计算 → 方法学审查Owner 与 Verifier 互相制衡Verifier 只能写自己的审查文档统计产物的哈希在复核前后被重查G4 图表与报告4 张结果图 → 报告初稿 → 写作审查G5 Slides 与验收7 页 PPTX → 案例打包 跨产物一致性校验执行状态10/10 工作单元完成0 失败、0 阻塞。每个模块的写入范围都被冻结例如统计模块只能写03-statistical-review/**越权写入会直接暴露。五、核心指标0.9917 的 ROC AUC 与克制的不确定性声明留集n114上的最终结果机器可读版本见 metrics.json指标留集随机基线 Dummy缩放逻辑回归ROC AUC0.5780.992平衡准确率0.5780.976F10.4710.976精确率0.4651.000混淆矩阵TP20, FP23TP40, FP0, FN2, TN72交叉验证方面逻辑回归 50 折 ROC AUC 均值0.9955标准差仅 0.0052各折表现高度稳定。值得留意的是克制度统计模块用 10000 次固定种子的分层 Bootstrap 给出区间、为敏感度/特异度记录 Wilson 区间但明确拒绝做正式显著性检验——因为重复折叠之间不独立单一留集也不能证明外部优越性。方法学审查同样只允许非临床、描述性、数据集内的声明。AI 生成的实验报告也能做到不夸大结论。六、17 项验收全部通过交付质量如何被证明案例打包后自动一致性校验器对全部产物做了17 项跨产物检查明细见 consistency-check.json结果17/17 通过、0 失败大致分三层检查层覆盖内容基础与计划28 个必需文件齐全、模块输出与冻结计划匹配、运行绑定 L 级计划、环境合同Python 版本与 18 个锁定包数据与复现数据集合同形状/类别/缺失/重复、455/114 划分与 5×10 CV 合同、留集与折叠指标一致、二次运行摘要完全一致交付物一致不确定性数值与metrics.json对账、图表哈希与来源映射、报告与 Slides 数值一致、双语摘要一致、产物路径不越界最终交付验收报告delivery-acceptance-report.json显示治理、工程验证、工作流完成、产品验收四类真相全部 passing才允许使用完成措辞。实验脚本本身也可复跑run_experiment.py 与一键重放脚本 reproduce.ps1。七、如何上手 VibeSkills上手只需三步一键安装运行 install.shWindows 用 install.ps1详细步骤见 docs/install/README.md使用统一入口安装后通过 SKILL.md 与 commands/vibe.md 描述的任务入口发起工作流编排引擎自动完成技能发现、选择与模块分配查看验收产物每个案例都会留下evidence/证据目录指标、检查与验收报告全部机器可读方便你自己审计 AI 的交付质量。小结这个案例展示了 VibeSkills 技能路由的完整价值链195 量级的候选技能池 → 精选 7 个 → 模块级分工执行 → 17 项检查背书。对新手来说你不需要记住装过哪些 Skills也不需要手动为每个环节指派能力——编排引擎负责调度验收机制负责兜底你只需要在开头描述目标在结尾审核带完整证据的交付物。【免费下载链接】Vibe-SkillsIntelligent Skill routing and workflow orchestration for AI agents — 21.12 pp reward, −29.6% tokens on SkillsBench with DeepSeekV4Flash-VE.项目地址: https://gitcode.com/gh_mirrors/vi/Vibe-Skills创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
