机器学习分类
按照训练数据和反馈方式,机器学习可分为监督学习、无监督学习、半监督学习和强化学习四大类。
按监督信号分类
监督学习(Supervised Learning)
- 训练数据包含输入和对应的正确输出(标签)
- 目标:学习从输入到输出的映射函数 y ≈ f(x)
- 常见任务:分类、回归
- 常见算法:线性回归、逻辑回归、决策树、随机森林、SVM、KNN、神经网络
无监督学习(Unsupervised Learning)
- 训练数据只有输入,没有标签
- 目标:发现数据中的隐藏结构或模式
- 常见任务:聚类、降维、密度估计、异常检测
- 常见算法:K-Means、DBSCAN、PCA、t-SNE、Gaussian Mixture Model
半监督学习(Semi-Supervised Learning)
- 少量有标签数据 + 大量无标签数据
- 目标:利用无标签数据提升模型性能
- 常见方法:自训练(Self-Training)、协同训练(Co-Training)、基于图的半监督学习
强化学习(Reinforcement Learning)
- Agent 在环境中行动,获得奖励或惩罚作为反馈
- 目标:最大化累积奖励
- 常见算法:Q-Learning、DQN、PPO、A3C
- 应用:游戏(AlphaGo)、机器人控制、自动驾驶
按任务类型分类
回归(Regression)
- 预测连续值输出
- 示例:房价预测、温度预测、股票价格预测
- 评估指标:MSE、MAE、R²
分类(Classification)
- 预测离散类别输出
- 二分类:垃圾邮件检测、疾病诊断
- 多分类:手写数字识别(0-9)、图像分类
- 评估指标:准确率、精确率、召回率、F1 Score、ROC AUC
聚类(Clustering)
- 将数据分成若干组,使组内相似度高、组间相似度低
- 示例:客户分群、文档主题聚类、图像分割
偏差-方差权衡
偏差(Bias)
- 模型预测值与真实值的差异
- 高偏差 → 欠拟合(Underfitting)
- 模型过于简单,无法捕捉数据模式
方差(Variance)
- 不同训练集上模型预测的波动程度
- 高方差 → 过拟合(Overfitting)
- 模型过于复杂,记住了训练数据的噪声
权衡关系
- 模型复杂度增加 → 偏差降低、方差升高
- 理想点:总误差(Bias² + Variance + Irreducible Error)最小
下表总结了偏差、方差与模型复杂度之间的关系:
| 指标 | 低复杂度模型 | 高复杂度模型 |
|---|---|---|
| 偏差 | 高 — 欠拟合 | 低 — 拟合充分 |
| 方差 | 低 — 预测稳定 | 高 — 预测波动大 |
| 训练误差 | 高 | 低(可能为 0) |
| 测试误差 | 高(欠拟合主导) | 高(过拟合主导) |
| 总误差 | 偏差主导 | 方差主导 |
下图展示了偏差、方差与模型复杂度之间的关系:
更直观地,偏差-方差权衡随模型复杂度的变化趋势如下:
| 模型状态 | 偏差 | 方差 | 表现 |
|---|---|---|---|
| 欠拟合(Underfitting) | 🔺 高 | 🔽 低 | 训练集和测试集误差都高 |
| 理想状态(Optimal) | 适中 | 适中 | 泛化能力最强 |
| 过拟合(Overfitting) | 🔽 低 | 🔺 高 | 训练集误差低,测试集误差高 |
偏差-方差与正则化
- L1 正则化(Lasso):增加偏差,降低方差。通过将不重要的特征系数压缩为 0,实现特征选择,适合高维稀疏数据。
- L2 正则化(Ridge):增加偏差,降低方差。通过约束权重大小,防止模型对某个特征过度敏感,适合特征间存在多重共线性的场景。
- 正则化强度 λ:λ 越大 → 惩罚越重 → 模型复杂度降低 → 偏差升高、方差降低。λ 的选择同样面临权衡,通常通过交叉验证确定最优值。
| 正则化类型 | 对偏差影响 | 对方差影响 | 适用场景 |
|---|---|---|---|
| L1(Lasso) | 增加较多 | 降低较多 | 特征选择、高维稀疏数据 |
| L2(Ridge) | 增加较少 | 降低较多 | 多重共线性、特征数量适中 |
| ElasticNet(L1+L2) | 介于两者之间 | 介于两者之间 | 特征数量多于样本数量 |
总结
- 按监督信号:监督/无监督/半监督/强化学习各有适用场景
- 按任务:回归(连续值)、分类(离散类别)、聚类(无标签分组)
- 偏差-方差权衡是模型选择的核心指导思想