大数据
大数据技术体系文档,从 Hadoop 生态与存储基础出发,逐步覆盖数据仓库、实时计算、OLAP 与数据治理等方向。
文档列表
Hadoop 基石
- 大数据技术全景概述 — 四 V 特性、架构演进、Lambda/Kappa、生态图谱与选型指南
- HDFS 架构深入 — NameNode/DataNode/SecondaryNameNode、读写流程、安全模式、HA 高可用
- HDFS 进阶 — 联邦架构、快照、回收站、短路读、纠删码、异构存储
- YARN 资源调度 — ResourceManager/NodeManager/Container、FIFO/Capacity/Fair 调度器
- MapReduce 编程模型 — Split/Map/Shuffle/Sort/Reduce 全流程、Combiner/Partitioner
- Hadoop 集群部署与调优 — 硬件选型、配置参数、JMX 监控、日志排查
- Hadoop 生态工具 — Sqoop 数据迁移、Flume 日志采集、Oozie 工作流、Hue 管理平台
列式存储与序列化
- HBase 深度 — HMaster/RegionServer 架构、MemStore/StoreFile/HFile、RowKey 设计、Compaction
- HBase 进阶 — Region 分裂合并、负载均衡、二级索引、Phoenix SQL 层、集群运维
- 文件格式对比 — Avro/Parquet/ORC 序列化与列式存储对比、压缩算法、Schema 演化
- ZooKeeper 在 Hadoop 生态中的角色 — Leader 选举、分布式协调、配置管理、一致性保障
- Hadoop 版本演进 — CDH/HDP/Cloudera 到 CDP 合并史、发行版选型、云原生 Hadoop
- 大数据集群安全 — Kerberos 认证、Ranger/Sentry 权限、数据加密、审计日志
- Hadoop 生态面试专题 — HDFS/YARN/MapReduce/HBase/ZK 高频考点深入问答
数据仓库建模
- 数据仓库核心概念 — Kimball 维度建模 vs Inmon 范式建模、星型/雪花型/星座型
- 数仓分层架构 — ODS/DWD/DWS/ADS/DIM 各层职责、数据流向、命名规范
- 缓慢变化维度 — SCD Type 1/2/3/4/6 实现方案、拉链表设计、全量/增量策略
- 数据质量体系 — 完整性/准确性/一致性/及时性、质量监控、数据稽核、修复机制
- 元数据管理 — 数据血缘、数据地图、指标口径、数据字典、资产管理
- 数仓规范化设计 — 命名规范、类型约定、生命周期管理、权限模型
- 企业数仓架构实战案例 — 电商/金融/物联网数仓架构设计示例
Hive 深度
- Hive 架构 — Metastore/Driver/Compiler/Executor、HiveQL 到 MapReduce/Tez/Spark 的转换
- Hive DDL/DML 深入 — 内外部表、分区表、分桶表、事务表、视图、索引
- Hive SQL 优化 — 数据倾斜、Join 优化、Map/Reduce 数调优、谓词下推、矢量化查询
- Hive 高级特性 — ACID 事务、物化视图、LLAP 加速、Cost-Based Optimizer、UDF/UDAF/UDTF
- Impala / Presto / Trino 对比 — MPP 架构、内存计算、Hive 对比、适用场景
- Hive 与数仓面试专题 — Hive 调优、数据倾斜、分区策略、OLAP vs OLTP 高频问答
Spark Core
- Spark 架构总览 — Driver/Executor/ClusterManager 角色、Job/Stage/Task 三层模型、DAG 执行流程、SparkEnv
- RDD 深入 — RDD 五大特性、窄/宽依赖、血统容错、缓存与 Checkpoint 对比、持久化策略
- Spark 调度机制 — FIFO/Fair 调度、Stage 划分算法、Task 调度与数据本地性、推测执行、动态资源分配
- Spark Shuffle 机制 — Hash 到 Sort 到 Tungsten 演进、Shuffle 读写流程、调优参数、数据倾斜治理
- Spark 内存管理 — 统一内存模型、堆内/堆外内存、执行与存储动态借用、OOM 排查
- Spark 部署模式 — Local/Standalone/YARN/Kubernetes 对比、Client/Cluster 部署、动态资源分配
- Spark Core 面试专题 — RDD 算子、重分区、缓存策略、血统容错、OOM 排查高频问答
Spark SQL 与 DataFrame
- Spark SQL 架构 — Catalyst 优化器与 Tungsten 执行引擎、DataFrame/Dataset/RDD 关系、SQL 执行全流程
- Catalyst 优化器深入 — Parser/Analyzer/Optimizer/SparkPlanner 四阶段、逻辑计划到物理计划、规则优化机制
- Spark SQL 优化实战 — AQE 自适应查询、动态分区裁剪、Join hint、BroadcastJoin 配置与调优
- Spark 读写外部数据源 — JDBC/Hive/HBase/Kafka/ES/Redis 连接器使用与参数调优
- Spark 与 Hive 集成 — Spark on Hive、Hive on Spark、Metastore 共享、性能对比
- Spark SQL 面试专题 — DataFrame 操作、UDF/UDAF/UDTF、Shuffle 算子优化、倾斜解决方案问答
- 离线报表 ETL 综合案例 — 电商离线报表 Spark Core + SQL 全流程 ETL 流水线实战
Spark Streaming 与图计算
- Spark Streaming 原理 — DStream 离散化流、Receiver 架构、Batch Interval 批次调度、与 Storm/Flink 对比
- Structured Streaming 核心 — 微批/连续两种模式、Event-time 处理、Watermark 水位线、状态管理
- Streaming 精确一次语义 — checkpoint/WAL 容错、幂等输出与事务输出、端到端 Exactly-Once 方案
- Spark Streaming 与 Kafka 集成 — Direct 方式消费、offset 管理、背压机制、端到端语义保证
- 图计算 GraphX — 属性图模型、Pregel 迭代框架、PageRank/TriangleCount、自定义图算法
- MLlib 机器学习基础 — ML Pipeline 特征工程、分类/回归/聚类/协同过滤、模型保存加载
- Spark 性能调优总结 — 资源分配、并行度、序列化、GC 调优、倾斜处理、动态资源
Flink 基础
- Flink 架构总览 — JobManager/TaskManager、Task Slot 与并行度、RPC 通信、与 Spark Streaming 对比
- Flink DataStream API — Source/Transformation/Sink、KeyedStream/WindowedStream、UDF 算子链
- Flink 窗口机制 — 滚动/滑动/会话/全局窗口、触发器 Triggers、驱逐器 Evictors
- Event Time 与 Watermark — 乱序处理、水位线生成策略、Allowed Lateness、侧输出
- Flink 状态管理 — 键控/算子状态、Value/List/Map/Reducing 状态、Memory/Fs/RocksDB 后端
- Checkpoint 与 Savepoint — Barrier 对齐、Exactly-Once 语义、配置与调优
- Flink 容错与恢复 — 重启策略、Failover 策略、Task/算子/作业级恢复、HA 高可用
Flink 进阶
- Flink Table 与 SQL — 动态表与持续查询、CDC Connector、Temporal Join、维表 Join
- Flink 与 Kafka 集成 — Kafka Source/Sink、offset 提交、动态分区发现、Exactly-Once 写入
- Flink CDC 实战 — MySQL/PG CDC、Debezium 集成、全量+增量同步、生产实践
- Flink 复杂事件处理 CEP — Pattern API、NFA 引擎、超时处理与侧输出、风控场景
- Flink 部署 — Standalone/YARN/Kubernetes、高可用配置、内存模型与资源配置
- Flink 调优 — 数据倾斜、反压、网络缓存、序列化、State Backend 选型
- Flink 面试专题 — 容错、状态、窗口、时间语义、CDC、反压排查高频问答
数据湖与湖仓一体
- 数据湖概念与演进 — Data Lake vs Warehouse vs Lakehouse、Lambda vs Kappa 架构
- Apache Iceberg 深入 — 表格式与元数据层级、快照隔离、时间旅行、Schema/分区演化、ACID
- Delta Lake 深入 — 事务日志、ACID、版本控制、Z-Order、Schema 强制/演化
- Apache Hudi 深入 — CoW vs MoR、增量查询、Clustering、Cleaner
- 三大数据湖格式对比 — Iceberg vs Delta vs Hudi 选型依据
- 数据湖集成方案 — Spark/Flink/Hive/Presto 对接、Catalog 配置
- Lakehouse 架构实战 — Iceberg + Spark + Flink 实时湖仓一体架构
实时数仓
- 实时数仓架构设计 — 实时分层 ODS/DWD/DWS/ADS、Kafka 消息标准化、与离线差异
- 实时 ETL 设计 — CDC 入湖、清洗转换补齐、维表关联、双流 Join、质量保障
- 实时指标计算 — PV/UV 去重、留存、漏斗、GMV 实现方案
- 数据管道 Data Pipeline — Kafka → Flink → Iceberg → ClickHouse/Doris 完整链路
- 实时数据回溯与修正 — 回溯触发、大窗口处理、延迟补偿、数据对账
- Flink 与 Paimon 实时数仓 — Paimon 表格式、Changelog Producer、Merge Engine、实时更新
- 实时数仓面试专题 — Lambda vs Kappa、去重、回溯、一致性问答
OLAP 引擎
- ClickHouse 架构 — 列式存储、MergeTree 引擎族、分区与排序键、向量化执行
- ClickHouse 表引擎深入 — Replacing/Summing/Aggregating MergeTree、分布式表
- ClickHouse 查询优化 — 索引设计、物化视图、Projection、JOIN、Skip Index
- ClickHouse 集群运维 — 分片副本、ZooKeeper/Keeper、扩容缩容、权限监控
- ClickHouse 生态集成 — Kafka 引擎表、JDBC/MySQL、HDFS/S3 集成
- Apache Doris 深入 — MPP 架构、分区/分桶、Rollup、Colocation Join、物化视图
- OLAP 引擎全面对比 — CH vs Doris vs Druid vs Kylin vs StarRocks 选型
- Apache Kylin 深入 — Cube 预计算、构建优化、查询下压、增量构建、BI 集成
- Apache Druid 深入 — 列式存储、时间分区、Segment、实时/批量摄入
- StarRocks 深入 — 存算一体/分离、CBO、主键模型、物化视图、Flink/Spark 集成
- 多表关联与 Join 优化 — Colocate/Bucket Shuffle/Broadcast Join、Runtime Filter
- 实时 OLAP 选型 — 报表、Ad-hoc、大屏、即席分析场景选型
- OLAP 面试专题 — 列式存储、物化视图、预聚合 vs 实时、分区分桶问答
数据集成
- CDC 技术全景 — 基于查询/日志的 CDC、Canal/Debezium/Maxwell/DataX、选型对比
- Canal 源码深入 — EventParser/EventSink/EventStore 架构、binlog dump 协议、HA 机制
- Debezium 深入 — Snapshot 模式、Kafka Connect 集成、Schema 变更处理、Exactly-Once
- 数据同步方案 — 全量 vs 增量、离线 vs 实时、异构数据源映射、断点续传
- SeaTunnel / DataX — 插件化架构、多源读写、限流/断点/脏数据处理、性能调优
- Kafka Connect — Source/Sink Connector 开发、REST API 管理、Standalone/Distributed 模式
- 数据集成面试专题 — CDC 原理、数据一致性、断点续传、异构同步高频问答
调度编排
- Apache Airflow 深入 — DAG 定义、Operator/Sensor/Hook、Celery/Kubernetes 执行器、XCom 通信
- Airflow 进阶 — 动态 DAG 生成、TaskFlow API、上下游依赖、重试/超时/告警、Pool
- DolphinScheduler 深入 — DAG 任务编排、工作流定义、租户/告警/环境管理、多租户架构
- 调度系统对比 — Airflow vs DolphinScheduler vs Azkaban vs Oozie,选型与迁移指南
- 任务生命周期管理 — 任务优先级、资源隔离、依赖管理、重跑/补数、灰度验证
- 数据开发平台设计 — 任务开发/SQL 编辑器/调度编排/运维监控/数据地图一站式架构
- 调度与编排面试专题 — DAG 调度、任务依赖、Airflow 架构、补数据策略高频问答
数据治理
- 数据治理全景 — 数据标准/质量/安全/生命周期、DCMM 成熟度模型
- Apache Atlas 数据目录 — 类型系统、元数据导入导出、血缘解析、分类/标签、安全审计
- DataHub / Amundsen — 元数据采集、Search/Lineage/Glossary、开放 API 对比
- 数据血缘 — 字段级血缘解析、SQL Parser 实现、Spark/Flink/Hive 血缘自动采集
- 数据质量平台 — Great Expectations / Deequ 质量验证框架、质量规则引擎、质量看板
- 数据安全治理 — 数据分级分类、脱敏策略、数据水印、访问审计、隐私合规
- 数据治理面试专题 — 元数据、血缘、质量、安全治理体系高频问答
大数据平台
- 大数据平台整体架构 — 采集/存储/计算/服务/应用五层架构、平台选型与硬件规划
- 数据服务平台 OneService — 统一查询网关、多引擎路由、SQL 审计、结果缓存、限流熔断
- 数据指标平台 — 指标管理、口径定义、指标血缘、OneData 方法论、指标体系设计
- 数据资产平台 — 资产盘点、资产目录、资产分级、资产血缘、资产运营报表
- 自助分析平台 — Superset/Metabase/Grafana 选型、嵌入集成、行级权限
- 大数据平台可观测性 — 集群/作业/数据监控、链路追踪、Prometheus + Grafana 实践
- 大数据平台面试专题 — 平台架构、集群规划、数据服务、自助分析高频问答
Kafka 深入
- Kafka 架构深度 — Controller/Broker/ISR/Leader 选举、日志分段、偏移量管理
- Kafka 副本机制 — Leader/Follower 同步、ISR 伸缩、Unclean 选举、Min ISR、Ack 原理
- Kafka 存储原理 — 日志分段、索引文件、Compaction、清理策略、页缓存与零拷贝
- Kafka 生产者与消费者 — 分区策略、批次压缩、幂等/事务、Rebalance、位移提交
- Kafka 集群运维 — 分区重分配、扩缩容、消息积压、Leader 均衡、网络线程模型
- Kafka Schema Registry — Avro/Protobuf/JSON Schema、兼容性检查、Flink/Spark 集成
- Kafka 面试专题 — ISR/LEO/HW、Rebalance、幂等事务、可靠性、顺序消费问答
消息平台
- Kafka Streams 深入 — 拓扑结构、状态存储、KTable/KStream、窗口操作、Exactly-Once
- 消息平台选型 — Kafka vs Pulsar vs RocketMQ vs RabbitMQ 全维度对比
- Apache Pulsar 深入 — BookKeeper 存储、Segment 架构、多层存储、IO 隔离、跨地域复制
- 消息平台运维 — Topic 治理、容量评估、限流降级、多集群容灾、异地多活
- 消息平台面试专题 — 选型对比、可靠性、顺序/事务/死信高频问答
机器学习与大数据
- 大数据上的机器学习流程 — 采集→特征→训练→评估→部署→AB 测试全链路
- Spark MLlib 进阶 — 特征提取/转换/选择、分类/回归/聚类/推荐算法、Pipeline 持久化
- 大规模特征工程 — Feature Store、实时特征计算、在线离线一致性、特征回溯
- 模型训练平台 — 分布式训练、GPU 资源管理、AutoML、MLflow 实验追踪
- 模型服务与推理 — 在线/批量推理、模型压缩量化、TensorRT/ONNX、AB 实验平台
- 推荐系统大数据架构 — 实时特征、召回、排序、重排、离线实时结合全链路
- ML on Big Data 面试专题 — 特征工程、模型部署、实时推理、Feature Store、AB 实验问答
前沿趋势与生态盘点
- 实时数据湖架构演进 — 数据湖 1.0 到 Lakehouse 2.0、流批一体技术趋势
- 云原生大数据 — 对象存储上的 HDFS、Kubernetes 运行 Spark/Flink、存算分离
- 数据网格 Data Mesh — 分而治之数据治理、领域数据产品、联邦治理
- 大数据开源项目大盘点 — 存储/计算/表格式/OLAP/消息/调度/治理核心项目对比
- 大数据生态全链路选型总览 — 离线/实时/OLAP/消息/调度/治理各场景推荐组合
- 大数据全栈学习路线总结 — 入门到进阶学习路径、推荐书籍/课程/认证、项目实践指南
- 大数据技术大全 — BD 名词中英文对照表、架构图集、命令速查、参考链接汇总