机器学习的分类
机器学习可以从多个维度进行分类。最经典的划分方式是按学习方式分为监督学习、无监督学习、半监督学习和强化学习;此外还可以按任务类型、模型形式、学习策略等进行划分。
所属专题:机器学习基础 (ml-basics·02)
机器学习的分类
机器学习可以从多个维度进行分类。最经典的划分方式是按学习方式分为监督学习、无监督学习、半监督学习和强化学习;此外还可以按任务类型、模型形式、学习策略等进行划分。
一、按学习方式分类(最主流)
1. 监督学习(Supervised Learning)
定义:训练数据包含”输入 + 标签”,模型学习从输入到输出的映射 f: X → Y。
数据形式:{(x⁽¹⁾, y⁽¹⁾), (x⁽²⁾, y⁽²⁾), …, (x⁽ᵐ⁾, y⁽ᵐ⁾)}
两大子任务:
| 任务 | 输出类型 | 例子 | 常用算法 |
|---|---|---|---|
| 分类(Classification) | 离散标签 | 垃圾邮件识别、图像分类、疾病诊断 | 逻辑回归、SVM、决策树、随机森林、KNN、朴素贝叶斯、神经网络 |
| 回归(Regression) | 连续数值 | 房价预测、销量预测、气温预测 | 线性回归、岭回归、Lasso、回归树、GBDT、神经网络 |
优点:目标明确、精度高、可解释性相对较好 缺点:需要大量高质量标注数据,人工标注成本高
2. 无监督学习(Unsupervised Learning)
定义:训练数据只有输入 x,没有标签 y,模型自行发现数据中的结构或模式。
主要任务:
| 任务 | 目标 | 例子 | 常用算法 |
|---|---|---|---|
| 聚类(Clustering) | 将相似样本分组 | 用户分群、图像分割 | K-Means、DBSCAN、层次聚类、GMM |
| 降维(Dimensionality Reduction) | 压缩特征、可视化 | 数据可视化、去噪、特征提取 | PCA、t-SNE、UMAP、LDA、Autoencoder |
| 密度估计(Density Estimation) | 学习数据分布 | 异常检测 | KDE、GMM |
| 关联规则(Association Rule) | 发现频繁模式 | 购物篮分析(啤酒-尿布) | Apriori、FP-Growth |
优点:不需要标签,可挖掘未知规律 缺点:效果难以量化评估,结果解释性较弱
3. 半监督学习(Semi-Supervised Learning)
定义:训练数据中少量有标签 + 大量无标签,同时利用两者训练模型。
适用场景:标注成本高但无标签数据丰富的场景(如医学影像)
常用方法:
- 自训练(Self-training)
- 协同训练(Co-training)
- 图半监督学习(Label Propagation)
- 一致性正则化(如 Π-Model, Mean Teacher)
- 伪标签(Pseudo-labeling)
4. 自监督学习(Self-Supervised Learning)
定义:从无标签数据中自动构造监督信号进行训练,是当前大模型的基石。
核心思想:设计”预训练任务(pretext task)“让模型从数据本身学习表示。
典型例子:
- NLP:BERT 的掩码语言模型(MLM)、GPT 的下一个词预测
- CV:MAE(掩码图像建模)、SimCLR / MoCo(对比学习)、DINO
- 多模态:CLIP(图文对比学习)
为什么重要:让大规模无标签数据(互联网文本、图像)成为可用训练资源,催生了 GPT、Claude、BERT 等大模型。
5. 强化学习(Reinforcement Learning, RL)
定义:智能体(Agent)通过与环境(Environment)交互,根据奖励信号(Reward)学习最优策略(Policy)。
核心要素:
动作 action
Agent ────────────→ Environment
↑ │
│ 状态 state │
│ 奖励 reward │
└────────────────────┘
- 状态 s:环境当前情况
- 动作 a:智能体的选择
- 奖励 r:环境的反馈
- 策略 π:从状态到动作的映射
- 价值函数 V/Q:评估状态或动作的长期价值
主要方法:
| 类别 | 代表算法 |
|---|---|
| 值函数方法 | Q-Learning、SARSA、DQN |
| 策略梯度方法 | REINFORCE、A2C、A3C |
| Actor-Critic | DDPG、PPO、SAC |
| 基于模型 | Dyna-Q、MuZero |
应用:AlphaGo、机器人控制、自动驾驶、游戏 AI、RLHF(大模型对齐人类偏好)
二、按任务类型分类
| 任务 | 输入 → 输出 | 例子 |
|---|---|---|
| 分类 | x → 离散类别 | 情感分析、图像分类 |
| 回归 | x → 连续值 | 房价、股价预测 |
| 聚类 | X → 分组 | 用户分群 |
| 降维 | x ∈ ℝⁿ → z ∈ ℝᵏ (k≪n) | 可视化、特征压缩 |
| 排序 | 一组候选 → 排序结果 | 搜索、推荐 |
| 生成 | 噪声/条件 → 新样本 | 文本生成、图像生成 |
| 序列标注 | 序列 → 逐位置标签 | 命名实体识别、词性标注 |
| 结构化预测 | x → 结构化对象 | 句法树、图结构 |
| 异常检测 | x → 正常/异常 | 欺诈检测、故障预警 |
| 强化决策 | 状态 → 动作 | 游戏、机器人 |
三、按模型形式分类
1. 参数模型 vs 非参数模型
- 参数模型:参数数量固定(线性回归、逻辑回归、神经网络)
- 非参数模型:参数量随数据规模增长(KNN、核方法、决策树)
2. 生成式 vs 判别式
| 类型 | 建模对象 | 例子 |
|---|---|---|
| 判别式(Discriminative) | P(y|x) 直接建模决策边界 | 逻辑回归、SVM、CRF、大多数神经网络分类器 |
| 生成式(Generative) | P(x, y) 建模联合分布 | 朴素贝叶斯、HMM、GAN、扩散模型、GPT |
3. 线性 vs 非线性
- 线性模型:线性回归、逻辑回归、线性 SVM
- 非线性模型:核 SVM、决策树、神经网络、GBDT
4. 浅层 vs 深层
- 浅层学习:单层或少数几层(SVM、决策树、朴素贝叶斯)
- 深度学习:多层神经网络(CNN、RNN、Transformer、Diffusion)
四、按学习策略分类
1. 批量学习(Batch Learning)
一次性用全部数据训练,训练完成后模型固定。适合数据稳定的场景。
2. 在线学习(Online Learning)
数据逐条到来,模型持续更新。适合数据流场景(推荐、广告、金融)。
3. 迁移学习(Transfer Learning)
将在 A 任务上学到的知识迁移到 B 任务。例如:ImageNet 预训练模型微调用于医学影像分类。
4. 元学习(Meta-Learning)
“学会学习” —— 从多个任务中学习”如何快速学习新任务”。代表:MAML、Prototypical Networks。
5. 少样本 / 零样本学习
- Few-shot Learning:每类只有极少样本(1-5 个)
- Zero-shot Learning:训练时未见过的类别也能识别(CLIP、大语言模型的 zero-shot 能力)
6. 联邦学习(Federated Learning)
数据不出本地,多方协作训练全局模型。用于隐私敏感场景(医疗、金融)。
7. 主动学习(Active Learning)
模型主动选择”最有价值的样本”请求标注,降低标注成本。
五、按模型驱动方式分类
| 类型 | 特点 | 例子 |
|---|---|---|
| 数据驱动 | 从数据中学习规律 | 主流机器学习 |
| 知识驱动 | 依赖专家规则/知识图谱 | 传统专家系统 |
| 混合驱动 | 数据 + 知识 | 神经符号系统(Neuro-Symbolic AI)、RAG |
六、分类关系总览图
机器学习
│
┌──────────────┼──────────────┬──────────────┐
│ │ │ │
监督学习 无监督学习 强化学习 混合范式
│ │ │ │
┌────┴────┐ ┌────┴────┐ │ ┌──────┼──────┐
│ │ │ │ │ │ │ │
分类 回归 聚类 降维/生成 值函数/ 半监督 自监督 迁移
│ │ │ │ 策略/AC │ │ │
... ... ... ... ... ... ... ...
七、如何选择合适的方法
| 场景 | 推荐范式 |
|---|---|
| 有大量标注数据 | 监督学习 |
| 只有少量标注 + 大量无标签 | 半监督 / 自监督 + 微调 |
| 完全没有标签,想探索数据结构 | 无监督学习 |
| 涉及决策序列、有奖励信号 | 强化学习 |
| 目标任务数据少,相关领域数据多 | 迁移学习 |
| 数据不能集中(隐私) | 联邦学习 |
| 数据持续到来 | 在线学习 |
| 标注成本高 | 主动学习 / 自监督 |
八、要点小结
- 监督 / 无监督 / 强化学习 是最基础的三分法,但现代 AI 中 自监督学习 已成为大模型的核心范式。
- 分类维度不是互斥的:一个方法可以同时是”判别式 + 参数化 + 深度 + 监督”的。
- 现代大模型(GPT、Claude、BERT)通常是:自监督预训练 → 监督微调(SFT)→ 强化学习对齐(RLHF) 的组合。
- 选择方法时,先看数据有无标签、再看任务类型、最后看规模与部署约束。