第 2 章 LLM模型类型机器学习

第 2 章 模型类型全景:从传统模型到 LLM

第 2 章 模型类型全景:从传统模型到 LLM

学习目标

  • 从六个维度给任何模型「贴标签」:学习范式、任务、结构、模态、规模、部署形态;
  • 掌握主流神经网络家族(MLP、CNN、RNN/LSTM、Transformer、GNN、Diffusion、GAN、VAE)的能力与适用场景;
  • 理解 Encoder-only、Decoder-only、Encoder-Decoder 三类 LLM 架构的分工;
  • 面对具体业务,能按一套决策框架选型。

2.1 一个模型 = 六个维度的标签

面对任何一个模型,都可以问六个问题,得到它的「身份证」:

%%{init: {"themeVariables": {"primaryTextColor": "#000000", "textColor": "#000000", "labelColor": "#000000", "nodeTextColor": "#000000", "labelTextColor": "#000000", "scaleLabelColor": "#000000"}}}%%
mindmap
  root((模型类型六维度))
    学习范式
      监督/无监督
      自监督/半监督
      强化学习
    任务
      分类/回归/排序
      检测/分割/生成
      检索/对话
    结构
      线性/树/集成/核/贝叶斯
      MLP/CNN/RNN/Transformer
      GNN/Diffusion/GAN/VAE
    模态
      文本/图像/语音/视频
      表格/时序/图/多模态
    规模
      小/中/大/基础模型/边缘
    部署形态
      在线/离线/流式/端侧

这六个维度不是互相独立的,它们之间有强相关性:规模大的模型几乎都是 Transformer 结构、几乎都是自监督预训练、几乎都跑在云端。但保持六个维度分开思考,能避免最常见的选型错误——比如「因为是大模型,所以一定能做时序预测」就是把模态和结构混为一谈了。

本章后面按这六个维度逐一展开。

2.2 按学习范式:监督、无监督、自监督、半监督、强化学习

学习范式回答的是「数据里的信号从哪来」。

  • 监督学习(Supervised):数据带标签 (x,y)(x, y),学映射 xyx \to y。分类、回归、排序是三大代表。信号来自人工标注。
  • 无监督学习(Unsupervised):数据无标签,学结构。聚类(K-Means)、降维(PCA)、异常检测是代表。信号来自数据自身的内在结构。
  • 自监督学习(Self-Supervised):无监督的特例,从数据本身构造「伪标签」。语言模型的「下一个词预测」、对比学习(CLIP、SimCLR)都是自监督。它是基础模型和 LLM 的基石——因为伪标签无限,数据规模不受人工标注限制。
  • 半监督学习(Semi-Supervised):少量有标签 + 大量无标签,用无标签数据辅助。常见于标注昂贵的领域(医疗影像)。
  • 强化学习(Reinforcement Learning, RL):智能体通过与环境交互获得奖励信号来学习策略。LLM 对齐里的 RLHF 就是强化学习(第 7 章展开)。

一个容易被忽略的点:LLM 的生命周期恰好把这五种范式串起来了——预训练用自监督,SFT 用监督,RLHF/DPO 用强化学习(或类 RL 偏好优化),合成数据与数据增强用半监督思想,而评测与反馈闭环本质是持续学习。所以「学习范式」不只是教科书分类,它就是 LLM 训练流水线的每一站。

2.3 按任务:分类、回归、排序、检测、分割、生成、检索、对话

任务是业务语言,结构是技术语言,中间要有一座桥。下表是主流任务及其典型结构:

任务类型 干什么 典型结构 LLM 时代的变化
分类 判断属于哪一类 LR、SVM、GBDT、CNN 文本分类被 LLM 统一为「生成分类标签」
回归 预测连续值 线性回归、GBDT、MLP 数值预测仍以传统模型为主
排序(Ranking) 给候选集排优先级 GBDT/LambdaMART、DSSM 推荐/搜索用 LLM 做召回与精排增强
检测 定位 + 分类物体 Faster R-CNN、YOLO 被 VLM 的 grounding 能力部分取代
分割 像素级语义标注 U-Net、Mask R-CNN 仍是视觉专用任务
生成 创造新内容 GAN、VAE、Diffusion、LLM 文本/图像生成全面 LLM/扩散化
检索 找出相关项 BM25、向量检索、双塔 RAG 把检索变成了 LLM 的标准组件
对话 多轮交互 Seq2Seq、DialogGPT 对话 = LLM 最主流的落地面

最关键的观察:LLM 正在把「任务」收敛成「生成」。过去十几种任务类型、十几种输出头、十几种损失函数,如今在 LLM 里统一为「生成一段 token」。但这不意味着其他任务消失了——凡是需要低延迟、高精度、确定性强的场景(排序、风控、时序),传统任务模型依然更优。选型时先问任务性质,再问模型能力。

2.4 按结构:从线性模型到生成式网络

2.4.1 传统结构:线性、树、集成、核、贝叶斯

  • 线性模型:LR、线性回归。简单、可解释、训练快,适合高维稀疏特征(广告、风控)。
  • 树模型:决策树、随机森林、GBDT/XGBoost/LightGBM。统治结构化表格数据,对特征尺度不敏感、能捕捉非线性、自带特征重要度。
  • 集成模型:Bagging(RF)降方差,Boosting(GBDT)降偏差,Stacking 组合异构模型。
  • 核方法:SVM。小样本、高维空间分类效果好,但难扩展到大数据。
  • 贝叶斯模型:朴素贝叶斯、贝叶斯网络、高斯过程。天然带不确定性估计,适合小数据与需要置信区间的场景。

工程选型铁律:结构化表格数据优先 GBDT,非结构化数据(文本、图像、语音)优先神经网络/LLM。 这个「两段论」在 LLM 时代依然成立,第 24 章的案例会给出完整论证。

2.4.2 神经网络家族

  • MLP(多层感知机):最基础的神经网络,适合中等规模表格与特征交互,是一切深度结构的基础件。
  • CNN(卷积神经网络):局部连接 + 权值共享 + 平移不变性,是视觉任务的默认选择,也用于文本(TextCNN)。
  • RNN/LSTM:处理序列的经典结构,串行计算、难以并行、长程依赖弱,已被 Transformer 取代(第 3 章详述原因)。
  • Transformer:自注意力 + 并行计算,统治文本、并扩展到视觉(ViT)与多模态。第 3 章主角。
  • GNN(图神经网络):处理图结构数据(社交网络、分子、知识图谱),与 LLM 结合构成 GraphRAG(第 17 章)。
  • Diffusion(扩散模型):图像/视频生成的主流(Stable Diffusion、Sora),通过逐步去噪生成样本。
  • GAN(生成对抗网络):生成器 + 判别器对抗训练,图像生成与风格迁移,训练不稳定,已被 Diffusion 部分取代。
  • VAE(变分自编码器):概率生成模型,隐空间连续,用于表示学习与生成。

一张图看结构演进与「谁取代了谁」:

%%{init: {"themeVariables": {"primaryTextColor": "#000000", "textColor": "#000000", "labelColor": "#000000", "nodeTextColor": "#000000", "labelTextColor": "#000000", "scaleLabelColor": "#000000"}}}%%
graph LR
    A[线性/树/核/贝叶斯] -->|表格数据仍在用| B[MLP]
    B --> C[CNN]
    B --> D[RNN/LSTM]
    C --> E[Transformer]
    D -->|序列建模被取代| E
    E --> F[Encoder-only BERT]
    E --> G[Decoder-only GPT]
    E --> H[Encoder-Decoder T5]
    E --> I[Diffusion/GAN 视觉生成]

2.4.3 LLM 架构三兄弟:Encoder-only、Decoder-only、Encoder-Decoder

Transformer 家族分三条技术路线,它们的区别决定了「能做什么、怎么训练、怎么用」:

架构 代表作 训练目标 特点 适合任务
Encoder-only BERT、RoBERTa MLM(掩码语言建模) 双向上下文,理解强 分类、NER、检索、句子相似度
Decoder-only GPT、Llama、Qwen CLM(下一个词预测) 自回归生成,生成强 文本生成、对话、Agent
Encoder-Decoder T5、BART Span Corruption / 去噪 编码理解 + 解码生成 翻译、摘要、受控生成

Decoder-only 为什么胜出:2020 年代初三种架构并存,最终 Decoder-only 几乎一统江湖(GPT、Llama、Qwen、DeepSeek 全是)。原因有三:

  1. 任务统一:任何任务都能表达为「给定前缀生成后缀」,理解任务也可以靠生成解决;
  2. 训练简单:CLM 目标天然自监督,无需像 MLM 那样构造掩码标签;
  3. 规模化稳定:自回归结构与推理时的 KV Cache 天然契合,长上下文扩展(RoPE、位置插值)也主要围绕 Decoder-only 展开。

但这不意味着 Encoder-only 死了——在检索(嵌入模型如 BGE、E5)、分类、NER 等「理解型」任务上,双向编码模型仍然效率更高、更省。第 3 章会深入 Decoder-only 的内部机理。

2.5 按模态:文本、图像、语音、视频、表格、时序、图、多模态

模态决定数据的「感官类型」,也决定了模型结构的选择:

模态 数据结构 主流模型 与 LLM 的关系
文本 token 序列 LLM、BERT LLM 主场
图像 像素矩阵 CNN、ViT、Diffusion VLM 把图像编码接入 LLM
语音 波形/频谱 Whisper、Conformer ASR + LLM 构成语音助手
视频 帧序列 VideoMAE、Sora 视频理解/生成
表格 结构化字段 GBDT、TabNet LLM 直接处理效果一般
时序 等间隔观测 LSTM、TCN、TimesNet 专业时序模型仍优于通用 LLM
节点+边 GNN GraphRAG 结合
多模态 混合 CLIP、GPT-4o、Qwen-VL 趋势所在

2.5.1 多模态是终局

单模态模型各自为政的时代正在结束。以 GPT-4o、Gemini、Qwen-VL 为代表的多模态 LLM 将文本、图像、音频统一到一个模型中:图像经视觉编码器(ViT/CLIP)转成视觉 token,与文本 token 一起进入 Transformer;输出可以是文本或图像。第 25 章的多模态案例会展开。

但**「多模态」不等于「所有任务都用多模态大模型」**:OCR、人脸识别、工业质检这类对精度和延迟要求极高的专用任务,专业小模型依然更合适。多模态 LLM 接管的是「理解 + 交互」类任务,专业模型接管的是「精准 + 实时」类任务。

2.6 按规模:小模型、中模型、大模型、基础模型、边缘模型

规模是本书最核心的变量之一(第 4 章专题展开),这里先建立直觉:

规模档位 参数量 部署形态 典型用途
边缘模型 <1B 手机、浏览器、端侧 离线小助手、语音识别
小模型 1B-7B 单卡/小集群 垂直任务微调、低成本服务
中模型 7B-70B 单机多卡 通用任务、RAG、Agent 主干
大模型 70B-500B 多机集群 高能力需求、旗舰服务
基础模型 >500B 万卡预训练 开源底座、闭源旗舰

两个重要概念:

  • 模型大小 ≠ 能力大小:7B 模型通过蒸馏、微调、RAG 在垂直场景上可能优于通用 70B 模型。规模是能力杠杆之一,不是全部(呼应第 1 章「涌现的争议」)。
  • 边缘模型 = 大模型的蒸馏产物:端侧模型(如 Llama 3.2 1B/3B、Qwen 1.5B)大多由大模型蒸馏而来,牺牲部分能力换取隐私、离线、低延迟。第 13 章蒸馏、第 18 章端侧部署展开。

2.7 按部署形态:在线、离线、流式、端侧

部署形态 延迟要求 特点 典型场景
在线(同步) ms-秒级 实时推理、高可用 对话、搜索、推荐
离线(批处理) 分钟-小时 吞吐优先、成本低 数据标注、批量打标、离线评估
流式 首个 token 快 边生成边输出 流式对话、直播字幕
端侧 本地即时 隐私、离线、低功耗 手机助手、车机

部署形态直接决定服务架构:在线服务要 GPU 集群 + 弹性伸缩(第 16 章),离线批处理用队列 + 批推理(第 15 章),端侧要量化 + 剪枝(第 13、18 章)。同一个模型,不同部署形态的工程复杂度天差地别——这是「全生命周期」视角最容易被忽略的维度。

2.8 选型决策框架:面对业务,选什么模型?

把六个维度收拢成一个决策流程:

%%{init: {"themeVariables": {"primaryTextColor": "#000000", "textColor": "#000000", "labelColor": "#000000", "nodeTextColor": "#000000", "labelTextColor": "#000000", "scaleLabelColor": "#000000"}}}%%
flowchart TD
    A[业务问题] --> B{数据模态?}
    B -->|结构化表格| C[GBDT/树模型
低延迟高精度] B -->|非结构化文本| D{任务类型?} B -->|图像/视频| E{精度 vs 泛化?} D -->|分类/NER/检索| F[Encoder-only 或
小 LLM + 微调] D -->|生成/对话/开放任务| G[Decoder-only LLM] E -->|高精度实时| H[专用 CNN/ViT] E -->|开放理解交互| I[VLM 多模态 LLM] C --> J{延迟与成本约束} F --> J G --> J J -->|极严| K[小模型+蒸馏+量化] J -->|一般| L[中/大模型+推理优化] J -->|宽松| M[旗舰大模型]

核心决策变量排序:模态 → 任务 → 规模/成本 → 延迟 → 数据可得性。而「数据可得性」是 LLM 时代的新变量——如果业务有高质量标注数据,微调小模型可能优于调用闭源大模型;如果没有数据,直接上大模型 + RAG 更现实。


本章要点回顾

  1. 任何模型都能用「学习范式、任务、结构、模态、规模、部署形态」六个维度定位。
  2. 学习范式五种:监督、无监督、自监督、半监督、强化学习;LLM 生命周期把它们全串了起来。
  3. 任务正在被 LLM「收敛成生成」,但排序、风控、时序等确定性任务仍是传统模型的天下。
  4. 表格数据用 GBDT,非结构化数据用神经网络/LLM——这个铁律依然成立。
  5. Decoder-only 因任务统一、训练简单、规模化稳定而胜出;Encoder-only 在理解型任务上仍有价值。
  6. 多模态是趋势,但「精准+实时」任务仍归专用小模型。
  7. 规模是能力杠杆但不是全部;部署形态决定工程复杂度。

习题

  1. 给「人脸识别闸机」这个业务,按六维度贴标签,并说明每个维度的选型理由。
  2. 为什么 Decoder-only 在 LLM 竞赛中胜出?试着从训练目标、推理效率、规模化三个角度论证。
  3. 一个电商搜索业务:query 匹配用 Encoder-only,生成式推荐语用 Decoder-only。为什么这样分工?有没有更好的方案?
  4. 时序预测(如销量预测)用 LLM 还是专业时序模型?说出你的判断和判断依据。

延伸阅读

  • Devlin et al., BERT: Pre-training of Deep Bidirectional Transformers, 2019
  • Raffel et al., Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer(T5), 2020
  • Radford et al., Language Models are Unsupervised Multitask Learners, 2019
  • Dosovitskiy et al., An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale(ViT), 2021
  • 推荐阅读 GBDT 三件套:XGBoost(Chen & Guestrin, 2016)、LightGBM(Ke et al., 2017)

下一章预告

第 3 章深入 Decoder-only 内部:Token 化、Embedding、位置编码、自注意力、KV Cache,把 LLM 这台机器的每一个核心零件拆开看。