超越ETL:构建企业分析的数据信任框架
企业持续在数据仓库、云解决方案和商业智能工具上投入巨资,但许多高管仍然对这些系统生成的数据存有疑虑。一个结构完善的数据信任框架填补了传统数据验证方法所忽视的空白:它区分了“有效运行的数据管道”与“高管真正信赖的报告”之间的差异。这种差异常被称为“报告漂移”,其成因在于转换逻辑在ETL管道、SQL存储过程和报表工具等不同系统中被重复使用并重新解释。大多数数据质量项目都专注于数据管道是否在没有技术问题的情况下顺利完成?行数是否匹配、模式是否一致、任务是否按时完成?这些检查虽然能验证数据是否正确地从一个系统传输到另一个系统,但无法确保数据在传输过程中其业务意义是否得以保留。例如,某项收入金额或员工总数可能成功通过所有技术验证阶段,却仍与组织其他部门计算出的相同指标不一致。
报表偏差的根源
在使用 ERP 系统及其他数据源的企业中,报表不一致的情况屡见不鲜。让我们考虑一种情况:一条数据管道将来自不同系统的公司员工人数和预算信息导入临时存储区。随后,一个 SQL 存储过程将这些信息合并,并应用业务规则(例如,在员工总数中不计入合同工)。该规则通常仅作为注释写在存储过程代码中,而非在所有人都能看到的地方。数月后,为进行人力规划等目的编写了另一段数据转换代码,该代码可能使用相同的临时数据再次计算员工人数,但并未应用排除合同工的同一规则。从某种角度来看,这两种计算结果都是正确的,而且它们可能会被分享给不同的群体,从而导致同一时间段内员工总数出现两个不同的结果。常规的数据管道监控方式无法发现此类错误,因为这两个任务都顺利完成了,因此问题出在业务逻辑上,而非数据传输过程中。
当数据定义不一致时,就会造成经济损失。Gartner的研究表明,数据质量低下导致企业每年平均损失1290万美元;而TDWI援引《哈佛商业评论》的分析则指出,不良或错误的数据可能导致企业损失12%–15%的收入。除了财务损失和指标不一致外,这还会迫使分析师花费更多时间修正数据,而非提出新思路。
数据不一致还会增加ERP厂商协助客户时的难度。企业必须确保数据的一致性,以防止这些问题并充分发挥其系统的潜力。
五层数据可信框架
数据可信框架通过确保在数据生命周期的每个阶段都确认业务相关性(而不仅仅是技术层面的实现),从而增强了对传统数据管道的监管。该框架由五层组成,可与标准的企业级工具配合使用:
源数据可靠性层:该层确认数据提取瞬间源系统(如ERP系统)的状态,包括记录数量以及独立于数据管道自身日志捕获的提取时间戳。该层可在下游处理开始前识别出部分提取或延迟提取的情况。
转换验证层:该层验证指定的转换(无论是SQL存储过程还是任何其他数据转换任务)是否按预期执行。这包括核对源数据和目标数据之间的行数,并验证聚合总和是否符合预期范围。
业务规则验证层:该层要求将业务规则(如承包商排除规则或收入确认时点)以版本化、集中文档化的定义形式确立,而非将逻辑分散嵌入到存储过程和笔记本中。数据管道和报表引用该注册表,而非自行重新创建规则。
语义一致性层:该层确保特定指标(如员工人数或收入)在各种报告工具中具有一致的定义。通用的语义层使可视化软件能够使用相同的规范化指标定义,而非基于不同的基础假设维护各自独立的计算字段。
高管报告保障层:该层在指标出现在高管报告之前引入正式的核对流程,追踪该值在前四个层中的流转情况,并确保发布前获得批准。
业务规则与语义一致性的实践应用
第三层和第四层旨在解决前文提到的特定失败模式,即不同团队以不同方式计算同一指标。TDWI关于语义层的研究强调,将业务定义整合到一个语义模型中(而非分散在各个商业智能工具中),可以实现更新后的计算公式只需修改一次即可普遍应用,而无需在众多报告中逐一调整。
在实践中,这需要一个简化的规则注册表,可将其建立为受控的数据库表,供数据管道及后续存储过程引用,而非重复生成。当业务规则发生修改时,变更将从单一源头传播,而无需在所有与受影响指标相关的管道和报告中逐一修订。语义层对报表工具也起着类似的作用,确保数据可视化数据集和数据源引用相同的规范化指标定义,而非各自生成的计算字段。
衡量影响
整合业务规则和语义定义的组织通常会获得两项可量化的成果。
首先,解决有争议指标所需的时间将大幅缩短,因为数据血统和规则版本信息会随指标一同记录,而无需通过存储过程和笔记本进行手动追踪。
其次,升级至高管层讨论的指标争议数量减少,因为不一致之处往往在报告发布前就在语义层被识别出来,而不是等到高管在会议上对某个数字提出质疑之后才被发现。
这些结果与前文提到的关于数据质量不足所造成损失的行业统计数据相吻合:指标波动带来的财务影响,与其说是受单个数字精度的影响,不如说是受在核对本应最初就一致的数字时所浪费的时间以及丧失的信任所影响。
源数据可靠性层和转换验证层同样能提供可量化的价值,尽管它们的优势更多在于预防而非纠正。
例如,通过从管道日志中单独获取源系统的记录计数,可以在部分ERP数据提取进入暂存层之前就将其识别出来,而不是在数周后因后续报告无法核对时才被发现。那些将这两个层视为单纯的合规性“勾选项”,而非与上层业务规则和语义层相联系的持续验证过程一部分的企业,往往会获得较少的收益,因为技术上经过验证的管道仍可能产生语义上不一致的结果。
入门指南
没有必要一次性实现全部五层,而且试图同时全面部署会增加在任何一层完全投入运行之前出现延迟的风险。一个有用的起点是业务规则验证层:企业可以确定其最具争议的指标,并将相关规则记录在一个统一的、可集中调用的位置。随后,数据转换任务可以进行修改,使其链接到该注册表,而不是依赖其自身的内置逻辑。
语义一致性层是自然而然的延伸,它将数据可视化工具与通用的指标定义相结合,取代了单独维护的计算方式。
数据信任框架并非取代现有的ETL监控或数据质量工具,而是引入了传统方法通常忽略的额外验证维度。即使底层的业务意义在各个系统中逐渐发生变化,数据管道仍可能多年运行无误。通过已注册的业务规则和通用的语义层直接解决这种差异,数据信任框架能够弥合技术上准确的数据与业务领导者愿意采用的分析结果之间的鸿沟。
作者:Pratham Yadav,数据工程师
来自 “ https://www.dbta.com/Editorial/Trends-and-Applicat ”
