OpenMetadata数据目录搭建指南30分钟接入数据源血缘图与质量检查一次跑通【免费下载链接】OpenMetadataThe Open Context Layer for Data and AI , OpenMetadata is the open platform for building trusted data context and business semantics for humans, AI assistants, and agents.项目地址: https://gitcode.com/GitHub_Trending/op/OpenMetadata哪张表才是权威口径、这个字段的数据从哪来、数字对不上谁去查——这三个问题足以让数据团队天天救火。OpenMetadata 是一个开源的元数据管理平台它会从各种数据源自动采集元数据集中管理再提供目录检索、血缘图和数据质量监控。这篇文章带你完成一个真实任务起环境、接一个库、找到表、看懂血缘、跑通一次质量检查。一条Docker Compose命令5分钟启动OpenMetadata服务克隆仓库后用 Docker Compose 一次拉起三个容器等就绪后打开http://localhost:8585就能用。git clone https://gitcode.com/GitHub_Trending/op/OpenMetadata cd OpenMetadata/docker/docker-compose-quickstart docker-compose up -d这条命令会同时启动 PostgreSQL 数据库、Elasticsearch 搜索引擎和 OpenMetadata 应用本体。容器全部就绪后浏览器里看到的就是你的数据目录首页。接入第一个数据库服务连接参数与包含排除过滤器先接一个真实数据源。在左侧「数据库」入口新建服务选择对应连接器MySQL、PostgreSQL、Snowflake 等填好主机、端口和凭据每个服务都能单独管理自己的连接参数与安全设置。连通后别急着跑采集顺手把包含/排除规则配一下用过滤条件圈定要收集哪些库、哪些模式、哪些表。这一步能避免把整个数仓的元数据一股脑拉进目录。配置完成后执行一次摄入表结构、列信息就会出现在目录里。查表结构与标签表详情页怎么看在检索框输入表名点进详情页列名、数据类型、描述、标签和最近摄入时间都一目了然。如果某张核心表还缺描述顺手补上并打好所属业务域的标签——这能省掉后来人翻代码问口径的时间。血缘图怎么看从源表一路追到目标表血缘在表详情页切换到「血缘」页签就能看它用有向图画出数据从源到目标的流向。想知道这张表挂了会影响哪些下游报表顺着节点上下游点一圈依赖关系会一层层展开。这些血缘是摄入框架解析查询自动提取的不需要你手工维护。跑一次数据质量检查定义测试规则并验证结果知道结构和血缘之后给表加一次质量检查。在数据质量入口创建测试比如主键列不能重复、关键字段不能为空保存后以测试工作流方式执行每条规则会给出通过或失败以及具体的失败条数。批量管理质量测试时Python SDK 更方便把测试写成配置文件示例工作流放在ingestion/examples/workflows目录照着改即可。长期运行加两个配置数据保留策略与Profiler剖析生产环境跑久了有两处配置值得打开。一是数据保留策略设定保留周期后OpenMetadata 会按策略自动清理内部数据库中的过时记录防止存储膨胀拖慢查询。二是 Profiler按数据类型勾选要计算的指标如重复计数、四分位数、列计数让数据健康度有更精确的量化画像。至此服务已起、数据源已接、血缘已明、质量检查已跑你的数据资产地图有了骨架。如果之后要改服务端连接参数、认证方式或 API 端点统一在conf/openmetadata.yaml里调整。下一步把你团队最核心的那个库接入进来并给它的几张关键表各挂 1~2 条质量规则。【免费下载链接】OpenMetadataThe Open Context Layer for Data and AI , OpenMetadata is the open platform for building trusted data context and business semantics for humans, AI assistants, and agents.项目地址: https://gitcode.com/GitHub_Trending/op/OpenMetadata创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
