数据治理面试专题
概述
数据治理面试覆盖:元数据管理、数据血缘、数据质量、数据安全、DCMM 体系。本文按概念、血缘、质量、安全、体系五类整理高频问答与实际案例。
一、概念与体系
Q1:数据治理包含什么?
四大支柱:
数据标准(口径)
数据质量(可信)
数据安全(可控)
数据生命周期(成本)
+ 元数据/血缘/资产支撑Q2:DCMM 是什么?
数据管理能力成熟度:
八大能力域
五级成熟度(初始→优化)
国家标准Q3:元数据有哪些类型?
| 类型 | 说明 |
|---|---|
| 技术元数据 | 表/字段/类型 |
| 业务元数据 | 含义/口径 |
| 管理元数据 | 负责人/来源 |
Q4:数据治理难点?
1. 组织保障(人)
2. 标准落地(规范)
3. 责任到人(Owner)
4. 持续运营(机制)
5. 效果量化(指标)二、数据血缘
Q5:血缘有什么作用?
1. 影响分析(改表影响谁)
2. 溯源(数据从哪来)
3. 下线评估(依赖)
4. 质量定位(问题源头)Q6:血缘怎么采集?
| 方式 | 说明 |
|---|---|
| Hive Hook | DDL/DML 上报 |
| Spark Listener | 作业监听 |
| SQL Parser | 静态解析 |
| Flink | SQL 解析 |
Q7:字段级血缘怎么实现?
SQL Parser:
AST → 识别 SELECT 列来源
映射目标列
处理函数/子查询/JoinQ8:血缘不准确怎么办?
1. 解析规则校验
2. Hook 覆盖补全
3. 手工补录
4. 定期对账三、数据质量
Q9:质量维度有哪些?
完整性、准确性、一致性
及时性、唯一性、有效性Q10:质量规则怎么定?
关键表优先:
非空、唯一、范围
枚举、对账、及时
按重要度分级Q11:质量发现后怎么处理?
闭环:
告警 → 定位(血缘)
→ 修复(重算)→ 验证Q12:GX 与 Deequ 区别?
GX:Python 声明式,文档化
Deequ:Spark 大规模,统计分析
按场景选四、数据安全
Q13:数据分级分类怎么做?
分类:个人信息/财务/商业...
分级:L1 公开 → L4 机密
识别(字段/内容/规则)
打标(元数据)Q14:脱敏方式有哪些?
掩码、替换、加密、哈希、截断
静态(导入导出)
动态(查询实时)Q15:怎么防数据泄露?
1. 权限最小化
2. 脱敏(默认脱敏)
3. 水印(追踪)
4. 审计(留痕)
5. 加密Q16:GDPR/PIPL 核心要求?
告知同意、最小必要
删除权、可携带
审计合规、泄露通知五、场景设计题
Q17:数据治理平台怎么建?
1. 元数据中心(采集/血缘)
2. 质量平台(规则/看板)
3. 安全平台(分级/脱敏)
4. 资产平台(目录/搜索)
5. 治理运营(指标/闭环)Q18:业务问"这个数据准不准"?
1. 看质量看板(规则结果)
2. 看血缘(来源链路)
3. 看口径(指标定义)
4. 看负责人(Owner)Q19:表要下线,怎么评估?
1. 查血缘下游依赖
2. 查使用方(作业/报表)
3. 评估影响
4. 审批 + 灰度下线Q20:质量问题频发怎么办?
1. 源头治理(采集校验)
2. 规则完善
3. 责任到 Owner
4. 修复闭环
5. 复盘沉淀六、实际案例
案例:电商数据治理
背景:
指标口径不一、质量问题多
方案:
1. 元数据采集 + 血缘
2. 统一指标口径(术语表)
3. 质量规则(关键表)
4. 敏感数据分级脱敏
5. 治理看板运营
成果:
指标一致、质量提升| 阶段 | 动作 |
|---|---|
| 盘点 | 元数据/血缘 |
| 标准 | 口径统一 |
| 质量 | 规则闭环 |
| 安全 | 分级脱敏 |
| 运营 | 指标看板 |
七、高频易错点
| 易错点 | 正确理解 |
|---|---|
| 治理是工具 | 组织+制度+工具 |
| 血缘只表级 | 字段级更精细 |
| 质量靠事后 | 源头治理 |
| 安全=加密 | 分级+脱敏+审计 |
| DCMM 是考试 | 是改进框架 |
八、速答清单
| 高频题 | 一句话答案 |
|---|---|
| 治理包含什么 | 标准/质量/安全/生命周期 |
| 血缘作用 | 影响分析/溯源 |
| 血缘采集 | Hook/Parser |
| 质量维度 | 完整/准确/一致/及时 |
| 安全怎么做 | 分级+脱敏+审计 |
| DCMM | 八大域五级 |
| 治理难点 | 组织与运营 |