大数据技术大全
概述
本文是速查手册:大数据常用名词中英文对照、生态架构图集、官方文档与学习链接汇总。适合随手查阅,也是面试前快速过一遍的清单。
一、核心名词中英对照
1.1 计算与存储
| 英文 | 中文 | 说明 |
|---|---|---|
| Batch Processing | 批处理 | 离线批量计算 |
| Stream Processing | 流处理 | 实时流式计算 |
| DAG | 有向无环图 | 任务依赖图 |
| Shuffle | 洗牌 | 数据重分布 |
| Partition | 分区 | 数据分片 |
| Data Locality | 数据本地性 | 就近计算 |
| Columnar Storage | 列式存储 | 按列存储 |
1.2 数据架构
| 英文 | 中文 | 说明 |
|---|---|---|
| Data Warehouse | 数据仓库 | 结构化数仓 |
| Data Lake | 数据湖 | 全量数据存储 |
| Lakehouse | 湖仓一体 | 湖+仓能力 |
| Data Mart | 数据集市 | 面向主题 |
| Lambda Architecture | Lambda 架构 | 批+流结合 |
| Kappa Architecture | Kappa 架构 | 纯流架构 |
| Schema-on-Write | 写时模式 | 写入定结构 |
| Schema-on-Read | 读时模式 | 读取定结构 |
1.3 实时与一致性
| 英文 | 中文 | 说明 |
|---|---|---|
| CDC | 变更数据捕获 | 数据变更同步 |
| Event Time | 事件时间 | 事件发生时间 |
| Watermark | 水位线 | 乱序处理 |
| Exactly-Once | 精确一次 | 不重不丢 |
| At-Least-Once | 至少一次 | 可能重复 |
| Checkpoint | 检查点 | 状态快照 |
| Rebalance | 再平衡 | 分区重分配 |
1.4 数据治理
| 英文 | 中文 | 说明 |
|---|---|---|
| Metadata | 元数据 | 数据的数据 |
| Data Lineage | 数据血缘 | 数据来源去向 |
| Data Quality | 数据质量 | 完整性等 |
| Data Governance | 数据治理 | 数据管理 |
| Data Catalog | 数据目录 | 元数据目录 |
| Data Product | 数据产品 | 领域数据交付 |
| PII | 个人可识别信息 | 隐私数据 |
1.5 OLAP 相关
| 英文 | 中文 | 说明 |
|---|---|---|
| OLAP | 联机分析处理 | 分析型 |
| OLTP | 联机事务处理 | 事务型 |
| MPP | 大规模并行处理 | 并行架构 |
| Cube | 数据立方体 | 预聚合 |
| Rollup | 上卷 | 汇总 |
| Drill-down | 下钻 | 明细 |
| Materialized View | 物化视图 | 预计算结果 |
1.6 机器学习
| 英文 | 中文 | 说明 |
|---|---|---|
| Feature Engineering | 特征工程 | 特征处理 |
| Feature Store | 特征存储 | 特征管理 |
| Feature Leakage | 特征泄露 | 未来信息 |
| Model Serving | 模型服务 | 推理部署 |
| A/B Testing | AB 实验 | 对比实验 |
| Model Drift | 模型漂移 | 效果衰减 |
| AutoML | 自动机器学习 | 自动调参 |
二、生态项目速查表
2.1 分层项目清单
| 层次 | 项目 | 一句话定位 |
|---|---|---|
| 采集 | Canal/DataX/SeaTunnel | 数据同步 |
| 消息 | Kafka/Pulsar/RocketMQ | 消息管道 |
| 存储 | HDFS/对象存储/HBase | 数据存储 |
| 计算 | Spark/Flink/MapReduce | 数据处理 |
| 查询 | Presto/Trino/Impala | 即席查询 |
| OLAP | ClickHouse/Doris/StarRocks | 分析引擎 |
| 表格式 | Iceberg/Delta/Hudi | 湖仓表 |
| 调度 | Airflow/DolphinScheduler | 任务编排 |
| 治理 | Atlas/DataHub/Ranger | 元数据/权限 |
| 质量 | Great Expectations/Deequ | 数据质量 |
| ML | MLlib/MLflow | 机器学习 |
2.2 版本与许可证速记
Apache 顶级项目(部分):
Hadoop、Hive、Spark、Flink
Kafka、Pulsar、Iceberg、Hudi
Doris、ClickHouse(部分)、Airflow
注意:
ClickHouse 采用 Apache 2.0
StarRocks/Delta 各有商业版本
选型注意版本与许可三、架构图集(文字版)
3.1 离线数仓架构
离线数仓:
数据源(业务库/日志)
→ 采集(DataX/Flume)
→ ODS(原始层)
→ DWD(明细层)
→ DWS(汇总层)
→ ADS(应用层)
→ 报表/分析
调度:Airflow/DolphinScheduler
治理:元数据 + 血缘 + 质量3.2 实时数仓架构
实时数仓:
业务库(binlog)→ Canal → Kafka
→ Flink(清洗/加工)
→ Doris/StarRocks(服务层)
→ 大屏/实时报表/实时指标
关键:Kafka 消息分层(ODS/DWD/DWS)3.3 湖仓一体架构
湖仓一体:
对象存储(底座)
+ 表格式(Iceberg/Delta,ACID)
+ Spark(离线)/ Flink(实时)
+ Presto/Doris(查询)
+ 元数据/权限(治理)3.4 消息管道架构
消息管道:
生产者 → Kafka(分区/副本)
→ 消费者组(并行消费)
→ Flink/Spark/业务
可靠性:Ack/ISR/幂等/事务
监控:Lag/吞吐四、常用命令速查
4.1 HDFS
常用命令:
hdfs dfs -ls /path # 列出
hdfs dfs -put local /path # 上传
hdfs dfs -get /path local # 下载
hdfs dfs -rm -r /path # 删除
hdfs dfsadmin -report # 集群状态4.2 Kafka
常用命令:
kafka-topics --create --topic t --partitions 3 --replication-factor 2
kafka-topics --describe --topic t
kafka-console-producer --topic t
kafka-console-consumer --topic t --from-beginning
kafka-consumer-groups --describe --group g4.3 Hive/Spark SQL
常用命令:
hive -e "SELECT count(*) FROM t" # 执行 SQL
spark-sql -e "SELECT count(*) FROM t" # Spark SQL
spark-submit --class Main app.jar # 提交任务五、官方文档与参考链接
5.1 官方文档
| 项目 | 官网 |
|---|---|
| Hadoop | hadoop.apache.org |
| Hive | hive.apache.org |
| Spark | spark.apache.org |
| Flink | flink.apache.org |
| Kafka | kafka.apache.org |
| Iceberg | iceberg.apache.org |
| Delta Lake | delta.io |
| Hudi | hudi.apache.org |
| ClickHouse | clickhouse.com |
| Doris | doris.apache.org |
| StarRocks | starrocks.io |
| Airflow | airflow.apache.org |
| DolphinScheduler | dolphinscheduler.apache.org |
| Pulsar | pulsar.apache.org |
5.2 学习参考
高质量来源:
Apache 官方文档(首选)
GitHub 源码与 issue
云厂商最佳实践(阿里云/腾讯云/华为云)
技术社区(掘金/知乎/InfoQ)
源码解析博客论文/标准:
MapReduce(Google 论文)
Spanner/BigTable(原理参考)
TPC-H/TPC-DS(性能基准)
DCMM(数据管理能力成熟度)六、常见英文缩写
| 缩写 | 全称 | 中文 |
|---|---|---|
| ODS | Operational Data Store | 操作数据层 |
| DWD | Data Warehouse Detail | 明细层 |
| DWS | Data Warehouse Summary | 汇总层 |
| ADS | Application Data Store | 应用层 |
| ETL | Extract Transform Load | 抽取转换加载 |
| SLA | Service Level Agreement | 服务等级协议 |
| HA | High Availability | 高可用 |
| SRE | Site Reliability Engineering | 站点可靠性 |
| ISR | In-Sync Replicas | 同步副本 |
| HW | High Watermark | 高水位 |
| LEO | Log End Offset | 日志末端偏移 |
七、使用建议
速查用法:
面试前:过名词对照 + 架构图
写方案:抄架构图 + 组合选型
排障:查命令 + 查参考链接
学习:按官方文档深入八、小结
本手册把大数据知识压缩成对照表、架构图、命令、链接四类速查内容:名词对照帮你扫清术语,架构图帮你建立全局,命令表帮你上手实操,官方链接帮你继续深入。收藏备用,需要时随手查阅即可。