数据治理整体规划

   

1. 数据标准

· 目标: 消除歧义,实现数据互通和集成。

· 关键活动:

  · 业务术语表: 统一业务词汇的定义(如:什么是“活跃用户”?)。

  · 数据模型标准: 统一数据结构设计。

  · 编码与格式标准: 如国家代码(CN)、日期格式(YYYY-MM-DD)。

· 核心交付物: 《企业数据标准管理规范》。

 

2. 数据质量

 

· 目标: 确保数据可信,适合业务使用。

· 六个核心维度:

  1. 完整性: 数据是否存在空值。

  2. 准确性: 数据是否真实反映其所建模的客观事实。

  3. 一致性: 同一数据在不同系统、不同时间点是否一致。

  4. 唯一性: 数据记录是否重复。

  5. 及时性: 数据在需要时是否可用。

  6. 有效性: 数据是否符合预定的格式、类型和范围(与数据标准直接关联)。

· 核心交付物: 《数据质量评估报告》、《数据质量问题跟踪清单》。

 

3. 数据安全

 

· 目标: 保护数据隐私,防止数据泄露和滥用,满足合规要求。

· 关键领域:

  · 分类分级: 根据数据敏感度(如公开、内部、秘密、绝密)进行分类,并采取不同级别的保护措施。

  · 访问控制: 基于“最小权限原则”授权,确保用户只能访问其必需的数据。

  · 加密与脱敏: 对存储和传输的敏感数据进行加密;在测试、开发等场景中使用脱敏后的数据。

  · 审计与监控: 记录和监控对敏感数据的访问行为,以便事后追溯。

· 核心交付物: 《数据安全管理办法》、《数据分类分级指南》。

 

总结

一个成功的数据治理规划,需要让数据标准作为共同语言,用数据质量作为可信度保障,并由数据安全提供全程防护。这三者相互依赖,共同构成企业数据资产的基石,最终目标是释放数据价值,驱动业务增长。


数据治理实施工作

1. 数据采集

· 目标: 全面、高效、无失真地获取原始数据。

· 数据来源:

  · 业务数据库: 如 MySQL、Oracle 等,通过 SQL 查询或全量同步。

  · 日志文件: 用户行为日志(点击、浏览)、系统运行日志。

  · 传感器/物联网: 温度、湿度、GPS 位置等实时数据流。

  · 第三方API: 从天气服务、社交平台等获取外部数据。

  · 网络爬虫: 从公开网页上抓取数据。

· 关键技术:

  · ETL: 提取、转换、加载。传统数据仓库的集成方式。

  · ELT: 提取、加载、转换。现代大数据平台的常用方式,先将原始数据加载到数据湖中再处理。

  · CDC: 变更数据捕获,用于实时捕获数据库的增量变化。

  · 消息队列: 如 Kafka,用于处理高吞吐量的实时数据流。

 

2. 数据清洗

 

· 目标: 解决“脏数据”问题,提高数据质量,为分析提供可靠基础。

· 常见问题与处理技巧:

  1. 缺失值处理:

     · 删除: 直接删除缺失记录(当缺失比例很小且随机时)。

     · 填充: 使用平均值、中位数、众数或通过算法预测进行填充。

  2. 格式与内容不一致:

     · 标准化: 如将“北京”、“北京市”、“BeiJing”统一为“北京”。

     · 格式转换: 如将日期“20231001”转换为“2023-10-01”。

  3. 重复值处理:

     · 去重: 根据关键字段识别并删除完全重复或近似重复的记录。

  4. 异常值处理:

     · 识别: 使用统计方法(如 3σ 原则)或业务规则识别。

     · 处理: 分析原因,决定是修正、保留还是删除。

 

3. 数据结构化

 

· 目标: 将数据转换成有严格 schema 的模型,便于高效查询和分析。

· 核心概念:

  · Schema: 数据的“蓝图”或“表格结构”,明确定义了每个字段的名称、数据类型和约束。

  · 范式化: 消除数据冗余,优化存储(如传统的OLTP数据库)。

  · 反范式化: 适当增加冗余,减少表关联,优化查询性能(如数据仓库)。

· 常见结构:

  · 结构化数据: 预定义模型的表格数据,如关系型数据库的表。

  · 半结构化数据: 有一定结构但模式不固定,如 JSON、XML 日志。

  · 非结构化数据: 无预定义模型,如文本、图片、视频。数据结构化的目标就是将半/非结构化数据转化为更易用的结构化或半结构化形式。


名词解释

1. SQL

· 全称: Structured Query Language

· 解释: 用于管理和操作关系型数据库的标准计算机语言。你可以用它来创建、查询、更新和删除数据库中的数据。

· 类比: 就像你用英语向图书馆管理员询问书籍一样,SQL是你向数据库“询问”数据的语言。

· 核心功能:

  · SELECT(查询数据)

  · INSERT(插入数据)

  · UPDATE(更新数据)

  · DELETE(删除数据)

  · CREATE(创建表或数据库)

 

2. API

 

· 全称: Application Programming Interface

· 解释: 一套预先定义的规则和协议,允许不同的软件应用程序之间相互通信和交换数据。

· 类比: 餐厅的服务员。你(一个应用程序)告诉服务员你想点什么(请求),服务员会去厨房(另一个应用程序)把你的订单拿来(响应)。你不需要知道厨房是如何运作的。

· 在数据领域的应用: 用于从第三方服务(如天气数据、支付系统、社交平台)采集数据。

 

3. ETL

 

· 全称: Extract, Transform, Load

· 解释: 一种数据集成过程。

  1. 提取: 从源系统(如数据库、API)获取数据。

  2. 转换: 在独立的处理服务器上对数据进行清洗、格式化、计算等操作。

  3. 加载: 将转换后的数据写入目标数据仓库或数据库。

· 特点: 先转换,后加载。适合数据量不大、转换逻辑复杂的场景。

 

4. ELT

 

· 全称: Extract, Load, Transform

· 解释: ETL的一种现代变体。

  1. 提取: 从源系统获取数据。

  2. 加载: 将原始数据直接加载到目标数据仓库或数据湖中。

  3. 转换: 在数据仓库内部利用其强大的计算能力进行转换。

· 特点: 先加载,后转换。适合大数据量、需要保留原始数据的云数据仓库场景(如 Snowflake, BigQuery)。比ETL更灵活。

 

5. CDC

 

· 全称: Change Data Capture

· 解释: 一种技术,用于识别和捕获源数据库中的数据变更(增、删、改),并将这些变更实时地或近实时地应用到另一个系统(如数据仓库)。

· 类比: 数据库的“监控摄像头”,持续记录所有变化。

· 应用: 实现数据库的实时同步、构建实时数据仓库。

 

6. Kafka

 

· 解释: 一个开源的、高吞吐量的分布式消息队列或事件流平台。

· 核心功能: 像一个巨大的、永不停止的数据传送带。它能够接收来自众多数据源(生产者)的实时数据流,并将其暂存起来,供众多数据消费者按需读取和处理。

· 应用: 构建实时数据管道,解耦数据生产者和消费者,处理海量日志、点击流等。

 

7. 3σ 原则

 

· 读音: 三西格玛原则

· 解释: 一个统计学规则,用于识别异常值。在正态分布中:

  · 大约68%的数据落在均值±1个标准差(σ)范围内。

  · 大约95%的数据落在均值±2σ范围内。

  · 大约99.7%的数据落在均值±3σ范围内。

· 在数据清洗中的应用: 将落在 (均值 - 3σ, 均值 + 3σ) 这个范围之外的数据点,初步判定为异常值,并进行进一步检查。

 

8. 范式化

 

· 解释: 数据库设计的一种技术,通过拆分表和建立关系来消除数据冗余和避免数据异常(插入、更新、删除异常)的过程。

· 目标: 节约存储空间,保证数据一致性。

· 类比: 设计一个Excel表来管理学生和课程信息。

  · 不范式化: 一张大表,包含学生ID, 姓名, 课程ID, 课程名。如果一个学生选修多门课,他的姓名会被重复存储多次。

  · 范式化后:

    · 学生表:学生ID(主键), 姓名

    · 课程表:课程ID(主键), 课程名

    · 选课关系表:学生ID(外键), 课程ID(外键)

· 反范式化: 为了提升查询性能,会有意地增加一些数据冗余,是范式化的反向操作,常用于数据仓库设计。

 

Logo

腾讯云面向开发者汇聚海量精品云计算使用和开发经验,营造开放的云计算技术生态圈。

更多推荐