Evidently 快速上手100 指标一站式评测、测试与监控 ML 与 LLM 系统【免费下载链接】evidentlyEvidently is an open-source ML and LLM observability framework. Evaluate, test, and monitor any AI-powered system or data pipeline. From tabular data to Gen AI. 100 metrics.项目地址: https://gitcode.com/GitHub_Trending/ev/evidentlyEvidently 是一个开源的 ML 与 LLM 可观测性框架帮你评测、测试和监控从表格数据到生成式 AI 的各类系统内置 100 指标。适合刚接触模型上线、想在实验和 CI 里加质量检查的 Python 开发者。从模型上线后才发现变差说起线上跑着的老模型最折磨人的往往不是报错而是悄悄变差输入分布慢慢漂移了、坏数据混进来了、LLM 的回答开始敷衍了——但没有任何报警等你人工抽查时问题已经攒了一周。第二类痛点是评估口径不统一。团队里有人用 pandas 算 precision有人自己写脚本算 recall数字对不上评审时没法说谁对。Evidently 把 100 个指标封装成可复用的预设一次配置实验和 CI 跑的是同一套代码。核心指标速览先看几个关键事实全部来自 pyproject.toml 和项目文档项值当前版本0.7.21Python 要求≥ 3.10许可证Apache License 2.0内置评估指标100数据漂移统计检验20 种预设Preset类型6 种支持数据类型表格 文本LLM6 种预设在 presets/ 里DataSummaryPreset、DataDriftPreset、ClassificationPreset、RegressionPreset、TextEvals、RecsysPreset。预设Preset≈ 打包好的一组相关指标省得你逐个挑选。快速上手安装与最小可运行示例环境依赖很简单核心就一行pip install evidently最小示例是检测两份表格数据之间的数据漂移data drift ≈ 当前批次的分布和上线时的基准分布不一样了from evidently import Report from evidently.presets import DataDriftPreset report Report([DataDriftPreset(methodpsi)]) snapshot report.run(current_df, reference_df) # 第一个是当前批次第二个是基准 snapshot.save_html(drift.html)methodpsi用的是 PSI群体稳定性指数这种统计距离不指定时 Evidently 会按列类型自动挑选。典型用法三个入口场景都是Dataset→Report两步起步检测数据漂移与质量表格场景最常用DataDriftPreset和DataSummaryPreset。把上线前的数据当基准、新来的批次当当前数据跑一次就能看到哪些列分布变了、缺值率多少。仓库里的 examples/classic_ml_validation.ipynb 用成人数据集完整演示了这条流程。评测 LLM 输出文本场景靠 descriptors逐行评估器 ≈ 给每一行打一个分数的函数给每条回答打分再用TextEvals汇总。可以挂Sentiment情感、TextLength长度、IncludesWords是否出现抱歉这类拒答词也能接 LLM-as-judge 让模型按参考答案打分。examples/llm_input_output_validation.ipynb 里有一条可直接跑的问答评测流程。把报告变成 CI 里的自动测试给Report加include_testsTrue或给单个指标配gt/lt/eq等通过条件snapshot里就会带一组 pass/fail 结果。snapshot.json()和snapshot.dict()能把结果导成结构化数据直接喂给 CI 判断红绿。需要持续看趋势时跑evidently ui --demo-projects all起一个本地监控面板浏览器打开localhost:8000就能按时间轴看指标和测试结果的走势。关键细节与避坑漂移检测必须有基准数据。只传一份数据、第二个参数传NoneDataDriftPreset跑不出对比结果这是新手最常踩的坑。列类型要映射清楚。用DataDefinition(numerical_columns[...], categorical_columns[...])显式声明否则自动推断遇到日期、ID 列容易分错影响统计检验的选择。LLM 评测要装额外依赖。核心包默认不带模型用到LLMEval、语义相似度、向量漂移时才需要装llm可选依赖含 transformers、sentence-transformers 等见 pyproject.toml 的[llm]段。结果别只当图看。snapshot是可序列化对象save_html给人看json()/dict()给程序用两个都要留。选型参考适合用 Evidently想把评估 测试 监控收敛到一套 API需要在 CI/CD 里做回归检查同时维护表格模型和 LLM 应用想统一口径。更轻的选择只是偶尔画两张分布图、看一次缺值率直接用 pandas plotly 就够不必引入框架。更重的场景需要毫秒级流式监控、跨集群告警编排时开源版偏跑一批算一批这类需求可能要搭配专门的流处理方案。常见疑问Evidently 需要 GPU 吗不需要。核心是纯 Python 统计计算表格评测在 CPU 上就能跑只有启用 LLM-as-judge、语义相似度这类才涉及模型且属于llm可选依赖。表格数据和 LLM 输出能用同一套 API 吗能。都是Dataset→Report→snapshot三步区别只在预设表格用DataDriftPreset这类文本用TextEvals加 descriptors。能接到 CI/CD 里吗能。include_testsTrue生成 pass/failsnapshot.dict()拿到结构测试不通过时在 CI 里抛错即可仓库的 tests/ 目录就是这种用法的真实参考。下一步建议先跑 examples/ 里最贴近你任务的一个 notebook把snapshot.save_html()的输出打开看一遍再决定要不要开include_tests。【免费下载链接】evidentlyEvidently is an open-source ML and LLM observability framework. Evaluate, test, and monitor any AI-powered system or data pipeline. From tabular data to Gen AI. 100 metrics.项目地址: https://gitcode.com/GitHub_Trending/ev/evidently创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
