数据治理,简单理解相关概念快速入门
数据治理整体规划
1. 数据标准
· 目标: 消除歧义,实现数据互通和集成。
· 关键活动:
· 业务术语表: 统一业务词汇的定义(如:什么是“活跃用户”?)。
· 数据模型标准: 统一数据结构设计。
· 编码与格式标准: 如国家代码(CN)、日期格式(YYYY-MM-DD)。
· 核心交付物: 《企业数据标准管理规范》。
2. 数据质量
· 目标: 确保数据可信,适合业务使用。
· 六个核心维度:
1. 完整性: 数据是否存在空值。
2. 准确性: 数据是否真实反映其所建模的客观事实。
3. 一致性: 同一数据在不同系统、不同时间点是否一致。
4. 唯一性: 数据记录是否重复。
5. 及时性: 数据在需要时是否可用。
6. 有效性: 数据是否符合预定的格式、类型和范围(与数据标准直接关联)。
· 核心交付物: 《数据质量评估报告》、《数据质量问题跟踪清单》。
3. 数据安全
· 目标: 保护数据隐私,防止数据泄露和滥用,满足合规要求。
· 关键领域:
· 分类分级: 根据数据敏感度(如公开、内部、秘密、绝密)进行分类,并采取不同级别的保护措施。
· 访问控制: 基于“最小权限原则”授权,确保用户只能访问其必需的数据。
· 加密与脱敏: 对存储和传输的敏感数据进行加密;在测试、开发等场景中使用脱敏后的数据。
· 审计与监控: 记录和监控对敏感数据的访问行为,以便事后追溯。
· 核心交付物: 《数据安全管理办法》、《数据分类分级指南》。
总结
一个成功的数据治理规划,需要让数据标准作为共同语言,用数据质量作为可信度保障,并由数据安全提供全程防护。这三者相互依赖,共同构成企业数据资产的基石,最终目标是释放数据价值,驱动业务增长。
数据治理实施工作
1. 数据采集
· 目标: 全面、高效、无失真地获取原始数据。
· 数据来源:
· 业务数据库: 如 MySQL、Oracle 等,通过 SQL 查询或全量同步。
· 日志文件: 用户行为日志(点击、浏览)、系统运行日志。
· 传感器/物联网: 温度、湿度、GPS 位置等实时数据流。
· 第三方API: 从天气服务、社交平台等获取外部数据。
· 网络爬虫: 从公开网页上抓取数据。
· 关键技术:
· ETL: 提取、转换、加载。传统数据仓库的集成方式。
· ELT: 提取、加载、转换。现代大数据平台的常用方式,先将原始数据加载到数据湖中再处理。
· CDC: 变更数据捕获,用于实时捕获数据库的增量变化。
· 消息队列: 如 Kafka,用于处理高吞吐量的实时数据流。
2. 数据清洗
· 目标: 解决“脏数据”问题,提高数据质量,为分析提供可靠基础。
· 常见问题与处理技巧:
1. 缺失值处理:
· 删除: 直接删除缺失记录(当缺失比例很小且随机时)。
· 填充: 使用平均值、中位数、众数或通过算法预测进行填充。
2. 格式与内容不一致:
· 标准化: 如将“北京”、“北京市”、“BeiJing”统一为“北京”。
· 格式转换: 如将日期“20231001”转换为“2023-10-01”。
3. 重复值处理:
· 去重: 根据关键字段识别并删除完全重复或近似重复的记录。
4. 异常值处理:
· 识别: 使用统计方法(如 3σ 原则)或业务规则识别。
· 处理: 分析原因,决定是修正、保留还是删除。
3. 数据结构化
· 目标: 将数据转换成有严格 schema 的模型,便于高效查询和分析。
· 核心概念:
· Schema: 数据的“蓝图”或“表格结构”,明确定义了每个字段的名称、数据类型和约束。
· 范式化: 消除数据冗余,优化存储(如传统的OLTP数据库)。
· 反范式化: 适当增加冗余,减少表关联,优化查询性能(如数据仓库)。
· 常见结构:
· 结构化数据: 预定义模型的表格数据,如关系型数据库的表。
· 半结构化数据: 有一定结构但模式不固定,如 JSON、XML 日志。
· 非结构化数据: 无预定义模型,如文本、图片、视频。数据结构化的目标就是将半/非结构化数据转化为更易用的结构化或半结构化形式。
名词解释
1. SQL
· 全称: Structured Query Language
· 解释: 用于管理和操作关系型数据库的标准计算机语言。你可以用它来创建、查询、更新和删除数据库中的数据。
· 类比: 就像你用英语向图书馆管理员询问书籍一样,SQL是你向数据库“询问”数据的语言。
· 核心功能:
· SELECT(查询数据)
· INSERT(插入数据)
· UPDATE(更新数据)
· DELETE(删除数据)
· CREATE(创建表或数据库)
2. API
· 全称: Application Programming Interface
· 解释: 一套预先定义的规则和协议,允许不同的软件应用程序之间相互通信和交换数据。
· 类比: 餐厅的服务员。你(一个应用程序)告诉服务员你想点什么(请求),服务员会去厨房(另一个应用程序)把你的订单拿来(响应)。你不需要知道厨房是如何运作的。
· 在数据领域的应用: 用于从第三方服务(如天气数据、支付系统、社交平台)采集数据。
3. ETL
· 全称: Extract, Transform, Load
· 解释: 一种数据集成过程。
1. 提取: 从源系统(如数据库、API)获取数据。
2. 转换: 在独立的处理服务器上对数据进行清洗、格式化、计算等操作。
3. 加载: 将转换后的数据写入目标数据仓库或数据库。
· 特点: 先转换,后加载。适合数据量不大、转换逻辑复杂的场景。
4. ELT
· 全称: Extract, Load, Transform
· 解释: ETL的一种现代变体。
1. 提取: 从源系统获取数据。
2. 加载: 将原始数据直接加载到目标数据仓库或数据湖中。
3. 转换: 在数据仓库内部利用其强大的计算能力进行转换。
· 特点: 先加载,后转换。适合大数据量、需要保留原始数据的云数据仓库场景(如 Snowflake, BigQuery)。比ETL更灵活。
5. CDC
· 全称: Change Data Capture
· 解释: 一种技术,用于识别和捕获源数据库中的数据变更(增、删、改),并将这些变更实时地或近实时地应用到另一个系统(如数据仓库)。
· 类比: 数据库的“监控摄像头”,持续记录所有变化。
· 应用: 实现数据库的实时同步、构建实时数据仓库。
6. Kafka
· 解释: 一个开源的、高吞吐量的分布式消息队列或事件流平台。
· 核心功能: 像一个巨大的、永不停止的数据传送带。它能够接收来自众多数据源(生产者)的实时数据流,并将其暂存起来,供众多数据消费者按需读取和处理。
· 应用: 构建实时数据管道,解耦数据生产者和消费者,处理海量日志、点击流等。
7. 3σ 原则
· 读音: 三西格玛原则
· 解释: 一个统计学规则,用于识别异常值。在正态分布中:
· 大约68%的数据落在均值±1个标准差(σ)范围内。
· 大约95%的数据落在均值±2σ范围内。
· 大约99.7%的数据落在均值±3σ范围内。
· 在数据清洗中的应用: 将落在 (均值 - 3σ, 均值 + 3σ) 这个范围之外的数据点,初步判定为异常值,并进行进一步检查。
8. 范式化
· 解释: 数据库设计的一种技术,通过拆分表和建立关系来消除数据冗余和避免数据异常(插入、更新、删除异常)的过程。
· 目标: 节约存储空间,保证数据一致性。
· 类比: 设计一个Excel表来管理学生和课程信息。
· 不范式化: 一张大表,包含学生ID, 姓名, 课程ID, 课程名。如果一个学生选修多门课,他的姓名会被重复存储多次。
· 范式化后:
· 学生表:学生ID(主键), 姓名
· 课程表:课程ID(主键), 课程名
· 选课关系表:学生ID(外键), 课程ID(外键)
· 反范式化: 为了提升查询性能,会有意地增加一些数据冗余,是范式化的反向操作,常用于数据仓库设计。
更多推荐
所有评论(0)