AI 领域知识体系全景复盘
基础理论 → 模型 → 框架 → 应用 → 工程化 脑图式梳理,9 周 63 篇文档的知识精华
第 1 层:人工智能基础
核心概念与分类
| 概念 | 说明 |
|---|---|
| 人工智能 (AI) | 让机器模拟人类智能的广义范畴 |
| 机器学习 (ML) | 从数据中学习模式,无需显式编程 |
| 深度学习 (DL) | 基于多层神经网络的 ML 子集 |
机器学习分类
- 监督学习:回归、分类、序列标注
- 无监督学习:聚类、降维、密度估计
- 半监督学习:少量标注 + 大量未标注数据
- 强化学习:通过奖励信号学习决策策略
经典算法一览
| 算法类别 | 代表算法 |
|---|---|
| 线性模型 | 线性回归、逻辑回归、SVM |
| 树模型 | 决策树、随机森林、GBDT、XGBoost |
| 聚类算法 | K-Means、DBSCAN、层次聚类 |
| 降维算法 | PCA、t-SNE、UMAP |
| 集成学习 | Bagging、Boosting、Stacking |
模型评估
- 分类指标:准确率、精确率、召回率、F1-Score、AUC-ROC
- 回归指标:MSE、RMSE、MAE、R-squared
- 验证策略:K-Fold 交叉验证、留出法、留一法
Python 环境
核心工具链:NumPy、Pandas、Scikit-learn、Matplotlib、Seaborn、Jupyter Notebook。
第 2 层:深度学习核心
神经网络基础
- 感知机与多层感知机 (MLP)
- 激活函数:ReLU、Sigmoid、Tanh、GELU、Swish
- 损失函数:交叉熵、MSE、CTC Loss
- 优化器演进:SGD → Momentum → Adam → AdamW
PyTorch 框架
| 模块 | 用途 |
|---|---|
torch.Tensor | 核心张量运算与自动求导 |
torch.nn | 网络层、损失函数容器 |
torch.optim | 优化器实现 |
torch.utils.data | DataLoader、Dataset 数据流水线 |
torchvision | 图像数据预处理与预训练模型 |
CNN 与计算机视觉
- LeNet、AlexNet、VGG、ResNet、EfficientNet
- 基础操作:卷积、池化、批量归一化、Dropout
- 图像分类、目标检测、语义分割
RNN / LSTM / 序列建模
- RNN 原理与梯度消失问题
- LSTM 门控机制(遗忘门、输入门、输出门)
- GRU 简化变体
- 双向 RNN、堆叠 RNN
Transformer 架构
- 核心组件:自注意力机制、多头注意力、位置编码、Feed-Forward Network
- 里程碑模型:Transformer (Vaswani 2017) → BERT → GPT → ViT
- 注意力变体:Flash Attention、稀疏注意力、线性注意力
训练技巧
| 技巧 | 作用 |
|---|---|
| 学习率调度 | 预热 + 衰减,提升收敛稳定性 |
| 梯度裁剪 | 防止梯度爆炸 |
| 权重初始化 | Xavier、Kaiming 初始化 |
| 数据增强 | CutMix、MixUp、随机翻转 |
| 正则化 | L1/L2、Dropout、Label Smoothing |
迁移学习
- 预训练 + 微调范式
- 冻结与解冻策略
- 领域自适应与领域泛化
第 3 层:大语言模型 LLM
GPT 演进史
| 模型 | 发布时间 | 参数量 | 核心特性 |
|---|---|---|---|
| GPT-1 | 2018-06 | 117M | 单向 Transformer 预训练 |
| GPT-2 | 2019-02 | 1.5B | Zero-shot 能力初现 |
| GPT-3 | 2020-05 | 175B | In-context learning 大爆发 |
| GPT-3.5 / InstructGPT | 2022 | 175B | RLHF 对齐 |
| GPT-4 | 2023-03 | 未公开 | 多模态、推理增强 |
预训练数据工程
- 数据来源:Common Crawl、书籍、论文、代码库
- 数据清洗:去重、过滤、质量评分
- 分词器:BPE、SentencePiece、Unigram
- 数据配比:高质量数据重采样
指令微调与对齐
- 指令微调 (SFT):构建指令-回答数据对进行监督微调
- RLHF:奖励模型训练 + PPO 强化学习
- DPO:直接偏好优化,简化 RLHF 流程
- 对齐目标:有用性、诚实性、安全性
开源模型生态
| 模型家族 | 代表模型 |
|---|---|
| LLaMA | LLaMA 2/3、Llama 3.1 |
| Qwen | Qwen 2/2.5、QwQ |
| Mistral | Mistral 7B、Mixtral 8x7B |
| DeepSeek | DeepSeek V2/V3、R1 |
| ChatGLM | ChatGLM 3/4、GLM-4 |
| Yi | Yi 6B/34B |
| Baichuan | Baichuan 2、Baichuan 3 |
Prompt Engineering
- 基础技巧:Few-shot Chain-of-Thought、角色设定、格式约束
- 高级技巧:ReAct 框架、Self-Consistency、Tree of Thoughts
- 系统提示词设计:身份定义 + 任务描述 + 输出格式 + 边界约束
量化与推理优化
| 量化方法 | 精度 | 显存节省 |
|---|---|---|
| GPTQ | 4-bit / 3-bit | 约 4x |
| AWQ | 4-bit | 约 4x |
| GGUF (GGML) | 2-8 bit | 2-6x |
| BitsAndBytes | 4/8-bit NF4 | 约 2-4x |
LoRA / QLoRA
- LoRA:低秩适配矩阵,参数量减少 99%,训练显存降低 2/3
- QLoRA:4-bit 量化 + LoRA,支持 65B 模型单卡微调
- 关键参数:rank (r)、alpha、target_modules
第 4 层:RAG 检索增强生成
RAG 架构
用户查询 → 检索器 (Retriever) → 增强上下文 → 生成器 (LLM) → 最终回答- Naive RAG:索引 → 检索 → 生成
- Advanced RAG:查询重写 / HyDE / 粗排 + 精排 / 重排序
- Modular RAG:可插拔模块化设计
Embedding 模型
| 模型 | 维度 | 特点 |
|---|---|---|
| BGE Series | 768-1024 | BAAI 出品,中文友好 |
| text-embedding-3 | 256-3072 | OpenAI 高性能 |
| E5 / Instructor | 768-1024 | 指令式嵌入 |
| M3E | 768 | 国产开源嵌入 |
| Jina Embeddings | 768 | 长上下文支持 |
向量数据库
| 数据库 | 核心特性 |
|---|---|
| Chroma | 轻量级,快速原型 |
| Milvus | 分布式,亿级规模 |
| Qdrant | Rust 编写,高性能 |
| Pinecone | 托管服务,开箱即用 |
| Weaviate | 内置 GraphQL 接口 |
| FAISS | Meta 开源,本地高效 |
文档分块策略
| 策略 | 适用场景 |
|---|---|
| 固定长度分块 | 简单场景,实现容易 |
| 语义分块 | 保留语义完整性 |
| 递归分块 | LangChain 默认策略 |
| 基于文档结构 | Markdown / HTML 层级分割 |
| Agent 分块 | LLM 驱动智能分割 |
检索增强技术
- 查询改写:多查询扩展、假设文档嵌入 (HyDE)
- 重排序 (Reranking):Cross-Encoder 二次排序
- 混合检索:稠密检索 + 稀疏检索 (BM25) 加权融合
- 上下文压缩:LLM 提取 / 过滤不相关内容
GraphRAG
- 微软开源方案,将知识图谱融入 RAG 流程
- 社区检测 → 摘要生成 → 全局/局部检索
- 优势:回答全局性问题、实体间关系推理
- 不足:构建成本高、延迟较长
评估与优化
- 评估指标:Faithfulness、Answer Relevance、Context Precision、Hit Rate、MRR
- RAGAS 框架:端到端 RAG 评估套件
- 优化方向:分块大小调优、Top-K 调整、Prompt 优化、Embedding 模型更换
第 5 层:Agent 与 AI 工具链
Agent 范式
| 范式 | 核心思想 |
|---|---|
| ReAct | 推理 + 行动交替循环 |
| Plan-and-Execute | 先规划,再执行 |
| Reflection | 自我反思与修正 |
| Toolformer | 模型自主学习调用工具 |
| Function Calling | 结构化工具调用 |
LangChain
- 核心抽象:Model I/O、Retrieval、Chain、Agent、Memory、Callbacks
- LCEL (LangChain Expression Language):声明式链式组合语法
- 工具生态:内置搜索、计算器、API 等 200+ 工具
- LangSmith:调试、测试、监控平台
- LangServe:Chain 部署为 RESTful API
LangChain 源码关键模块
langchain-core:基础抽象接口langchain-community:第三方集成langchain.agents:Agent 框架与工具解析langchain.chains:预构建 Chain 实现
LlamaIndex
- 面向 RAG 的专用数据框架
- 核心概念:Document、Node、Index、Retriever
- 支持 40+ 数据连接器
- 智能路由 Router 引擎
Multi-Agent 系统
| 框架 | 特点 |
|---|---|
| AutoGen | 微软出品,多 Agent 对话框架 |
| CrewAI | 角色化 Agent 协作 |
| MetaGPT | 模拟软件公司角色协作编程 |
| LangGraph | 图状态机驱动的 Agent 工作流 |
| Swarm | OpenAI 实验性轻量多 Agent |
MCP 协议
- Model Context Protocol:模型上下文协议
- 统一 AI 应用与外部工具/数据的通信标准
- 由 Anthropic 提出,正在形成行业生态
- 核心组件:MCP Server、MCP Client、资源定义、工具注册
AI 编程工具
- GitHub Copilot、Cursor、Windsurf
- Claude Code、Devin、Aider
- 核心能力:代码补全、自然语言生成、上下文理解、Bug 修复
第 6 层:AI 应用开发与框架
Hugging Face 生态
- Transformers 库:统一 API 加载 10 万+ 预训练模型
- Datasets 库:高效数据加载与处理
- Accelerate:分布式训练零代码改
- PEFT:参数高效微调
- Hub:模型、数据集、Space 托管平台
图像识别与分类
- 经典模型:ResNet、DenseNet、EfficientNet、ConvNeXt
- 开源工具:MMClassification、TIMM
- 训练流程:数据标注 → 预处理 → 模型选择 → 微调 → 评估
目标检测
| 范式 | 代表模型 |
|---|---|
| 两阶段 | Faster R-CNN、Mask R-CNN |
| 单阶段 | YOLO 系列、SSD |
| Transformer | DETR、Deformable DETR |
| 开源框架 | MMDetection、Detectron2 |
自然语言处理
- 文本分类:情感分析、意图识别
- 序列标注:命名实体识别、词性标注
- 文本生成:摘要、翻译、创意写作
- 语义匹配:句子相似度、文本蕴含
- 信息抽取:关系抽取、事件抽取
语音 AI
- 语音识别:Whisper、Paraformer
- 语音合成:CosyVoice、Fish Speech
- 声纹识别:CAM++、ECAPA-TDNN
- 情感识别:语音情感分析
图像生成
| 模型 | 特点 |
|---|---|
| Stable Diffusion | 开源文生图基石 |
| ControlNet | 细粒度生成控制 |
| LoRA for SD | 角色/风格定制微调 |
| ComfyUI | 节点式工作流 |
| FLUX | 高性能新贵 |
视频理解
- 视频分类:VideoMAE、TimeSformer
- 时序动作检测:SlowFast、TSN
- 多模态视频理解:Video-LLaMA、InternVideo
第 7 层:浏览器端 AI 与边缘计算
浏览器 AI 概览
- 优势:零部署、数据隐私、离线可用
- 挑战:计算资源受限、模型体积、Web API 兼容性
- 核心 Web API:WebGPU、WebGL、WebAssembly、Web Workers
Transformers.js
- Hugging Face Transformers 的 JavaScript 移植版
- 支持 60+ 架构,涵盖 NLP、CV、语音
- 基于 ONNX Runtime Web 后端
- 使用量:npm 周下载量超 50 万
ONNX Runtime Web
- 微软开源推理引擎 Web 端
- 利用 WebGL / WebGPU 硬件加速
- 模型导出流程:PyTorch → ONNX → ORT Web 优化
TensorFlow.js
- 支持浏览器端训练和推理
- 提供了预训练模型 (MobileNet、PoseNet、BodyPix)
- 适合实时交互应用
前端 AI Demo 分类
| 任务类型 | 示例 |
|---|---|
| 图像分类 | MobileNet 实时识别 |
| 目标检测 | YOLO Web 版 |
| 姿态估计 | MoveNet、MediaPipe |
| 文本生成 | 浏览器小模型对话 |
| 语音识别 | Whisper WebAssembly |
| 图像生成 | Stable Diffusion Web |
边缘设备部署
- 目标硬件:树莓派、NVIDIA Jetson、手机、IoT 设备
- 模型压缩技术:量化、剪枝、蒸馏
- 推理引擎:TFLite、TensorRT、OpenVINO、CoreML
多模态浏览器应用
- 图片描述生成、实时翻译、视觉问答
- WebRTC + 浏览器 AI 实现实时视频分析
- WebGPU 加速大模型推理
第 8 层:AI 工程化与模型部署
Model Serving 方案
| 方案 | 适用场景 |
|---|---|
| FastAPI + Transformers | 小规模快速部署 |
| vLLM | 大模型高并发推理 |
| Triton Inference Server | 多模型异构 GPU 管理 |
| TGI (Text Generation Inference) | Hugging Face 官方方案 |
| Ollama | 本地一键拉起 |
vLLM 核心特性
- PagedAttention:高效显存管理,消除碎片
- 连续批处理 (Continuous Batching):动态调度请求
- 量化支持:GPTQ、AWQ、FP8
- 吞吐量:比原始 Hugging Face 实现提升 10-20 倍
AI API 服务设计
- 接口规范:OpenAI API 兼容格式
- 流式输出:Server-Sent Events (SSE)
- 身份认证:API Key、JWT、OAuth2
- 速率限制 (Rate Limiting):令牌桶算法
- 可观测性:Prometheus + Grafana 监控
Docker + GPU 环境
Dockerfile 关键配置:
- 基础镜像: nvidia/cuda:12.x-runtime-ubuntu22.04
- CUDA 版本与驱动兼容性
- torch / transformers 依赖安装
- 健康检查与自动重启策略K8s 推理部署
| 组件 | 作用 |
|---|---|
| KServe | 模型 Serving 专用 CRD |
| GPU 调度 | NVIDIA GPU Operator、节点亲和性 |
| 自动扩缩容 | HPA / KPA 基于 QPS 或 GPU 利用率 |
| 灰度发布 | 金丝雀部署、A/B 测试 |
MLOps 实践
- 实验管理:MLflow、Weights & Biases、Neptune
- 模型注册:MLflow Model Registry、DVC
- CI/CD for ML:DVC + CML、GitHub Actions
- 数据管线:Airflow、Prefect、Kubeflow
- 特征存储:Feast、Tecton
AI 安全与合规
| 风险领域 | 应对措施 |
|---|---|
| 提示注入 | 输入过滤、权限隔离 |
| 数据泄露 | 脱敏处理、访问控制 |
| 模型偏见 | 公平性评估、数据多样性 |
| 幻觉控制 | 事实核对、RAG 约束 |
| 合规要求 | 个人信息保护法、GDPR、算法备案 |
第 9 层:AI 项目实战
RAG 问答系统
- 技术栈:LangChain / LlamaIndex + 向量数据库 + LLM
- 关键模块:文档加载、分块、嵌入、检索、生成
- 优化方向:多轮对话、历史维护、引用溯源
Agent 工具链
- 技术栈:LangChain / LangGraph + Function Calling
- 典型场景:自动数据分析、网页摘要、调用 API
- 进阶:记忆管理、人机交互、错误自愈
多模态应用
- 图文理解:LLaVA、Qwen-VL、InternVL
- 语音助手:ASR + LLM + TTS 全链路
- 视频分析:视频抽帧 + 多模态模型
LLM 微调实践
| 阶段 | 工具 | 要点 |
|---|---|---|
| 数据准备 | Alpaca 格式,Self-Instruct | 数据质量 > 数量 |
| 全量微调 | DeepSpeed ZeRO-3 | 多卡并行通信优化 |
| LoRA 微调 | PEFT + BitsAndBytes | 单卡 7B-13B |
| 评估 | MT-Bench、AlpacaEval | 多维评分 |
AI 辅助开发
- Cursor / Copilot 提效技巧:精确描述意图、提供代码上下文
- 基于 AI 的 Code Review:安全扫描、最佳实践检查
- 自动化测试生成、文档生成、重构建议
技能雷达表
| 领域 | 核心知识点 | 掌握程度 | 推荐学习路径 |
|---|---|---|---|
| 人工智能基础 | ML 分类、经典算法、模型评估 | 扎实基础 | 吴恩达 ML 课程 + Scikit-learn 实战 |
| 深度学习核心 | PyTorch、CNN、RNN、Transformer | 扎实基础 | Fast.ai + d2l.ai 动手实践 |
| 大语言模型 | GPT 演进、微调、量化、Prompt | 进阶掌握 | Hugging Face NLP Course + LLaMA Factory |
| RAG 检索增强生成 | Embedding、向量库、GraphRAG | 进阶掌握 | LangChain RAG 文档 + RAGAS 评估 |
| Agent 与工具链 | LangChain、Multi-Agent、MCP | 持续积累 | LangGraph 官方教程 + AutoGen 源码 |
| AI 应用开发与框架 | Hugging Face、CV、NLP | 进阶掌握 | MM 系列工具箱 + 竞赛实战 |
| 浏览器端 AI | Transformers.js、ONNX Web | 入门了解 | WebGPU 规范 + 开源 Demo 复现 |
| AI 工程化部署 | vLLM、K8s、MLOps | 持续积累 | vLLM 文档 + K8s GPU 运维实战 |
| AI 项目实战 | 全流程落地经验 | 进阶掌握 | GitHub 开源项目复现 + 业务场景实战 |
学习路径总结
- 基础夯实阶段:掌握 Python 数据科学生态 + 经典 ML 算法 + PyTorch 基础
- 核心突破阶段:深入 Transformer + LLM 原理 + RAG 体系 + Agent 范式
- 应用实践阶段:选定垂直方向(NLP/CV/多模态)进行项目实战
- 工程纵深阶段:模型 Serving + 量化部署 + MLOps 完备链路
以上内容涵盖 9 大领域、63 篇文档的精要汇总,可作为 AI 知识体系的索引地图和查漏补缺的参考框架。