加载中...

数据血缘(Data Lineage)指数据从产生、加工、流转到最终消费的完整链路关系:某张表、某个字段由哪些上游数据经过何种计算得来,又被哪些下游报表与应用使用。它是元数据管理与数据治理的核心内容。
血缘通常按粒度分为表级与字段级。采集方式主要有:解析 SQL 与 ETL 脚本(静态解析执行计划或抽象语法树,推断输入输出关系)、从调度系统与计算引擎的运行日志中抓取实际读写行为、以及在数据管道中埋点上报。采集结果汇入元数据平台构建成有向图,支持正向的影响分析(上游改动会波及哪些下游)与反向的溯源分析(指标异常来自哪个环节)。开放规范 OpenLineage 与 Apache Atlas、DataHub、Marquez 等开源项目是该领域的代表工具。
典型场景包括数仓表下线前的影响评估、数据质量问题定位、合规审计(如个人数据流向追踪)以及成本治理中识别无人使用的冗余表。
血缘价值公认,但字段级血缘对复杂 SQL、UDF 与跨系统链路的解析仍是工程难点,完整性常依赖多种采集手段互补。

登录 后参与讨论
暂无讨论,来发表第一条评论吧