第 2 章 模型类型全景:从传统模型到 LLM
第 2 章 模型类型全景:从传统模型到 LLM
学习目标
- 从六个维度给任何模型「贴标签」:学习范式、任务、结构、模态、规模、部署形态;
- 掌握主流神经网络家族(MLP、CNN、RNN/LSTM、Transformer、GNN、Diffusion、GAN、VAE)的能力与适用场景;
- 理解 Encoder-only、Decoder-only、Encoder-Decoder 三类 LLM 架构的分工;
- 面对具体业务,能按一套决策框架选型。
2.1 一个模型 = 六个维度的标签
面对任何一个模型,都可以问六个问题,得到它的「身份证」:
%%{init: {"themeVariables": {"primaryTextColor": "#000000", "textColor": "#000000", "labelColor": "#000000", "nodeTextColor": "#000000", "labelTextColor": "#000000", "scaleLabelColor": "#000000"}}}%%
mindmap
root((模型类型六维度))
学习范式
监督/无监督
自监督/半监督
强化学习
任务
分类/回归/排序
检测/分割/生成
检索/对话
结构
线性/树/集成/核/贝叶斯
MLP/CNN/RNN/Transformer
GNN/Diffusion/GAN/VAE
模态
文本/图像/语音/视频
表格/时序/图/多模态
规模
小/中/大/基础模型/边缘
部署形态
在线/离线/流式/端侧这六个维度不是互相独立的,它们之间有强相关性:规模大的模型几乎都是 Transformer 结构、几乎都是自监督预训练、几乎都跑在云端。但保持六个维度分开思考,能避免最常见的选型错误——比如「因为是大模型,所以一定能做时序预测」就是把模态和结构混为一谈了。
本章后面按这六个维度逐一展开。
2.2 按学习范式:监督、无监督、自监督、半监督、强化学习
学习范式回答的是「数据里的信号从哪来」。
- 监督学习(Supervised):数据带标签 ,学映射 。分类、回归、排序是三大代表。信号来自人工标注。
- 无监督学习(Unsupervised):数据无标签,学结构。聚类(K-Means)、降维(PCA)、异常检测是代表。信号来自数据自身的内在结构。
- 自监督学习(Self-Supervised):无监督的特例,从数据本身构造「伪标签」。语言模型的「下一个词预测」、对比学习(CLIP、SimCLR)都是自监督。它是基础模型和 LLM 的基石——因为伪标签无限,数据规模不受人工标注限制。
- 半监督学习(Semi-Supervised):少量有标签 + 大量无标签,用无标签数据辅助。常见于标注昂贵的领域(医疗影像)。
- 强化学习(Reinforcement Learning, RL):智能体通过与环境交互获得奖励信号来学习策略。LLM 对齐里的 RLHF 就是强化学习(第 7 章展开)。
一个容易被忽略的点:LLM 的生命周期恰好把这五种范式串起来了——预训练用自监督,SFT 用监督,RLHF/DPO 用强化学习(或类 RL 偏好优化),合成数据与数据增强用半监督思想,而评测与反馈闭环本质是持续学习。所以「学习范式」不只是教科书分类,它就是 LLM 训练流水线的每一站。
2.3 按任务:分类、回归、排序、检测、分割、生成、检索、对话
任务是业务语言,结构是技术语言,中间要有一座桥。下表是主流任务及其典型结构:
| 任务类型 | 干什么 | 典型结构 | LLM 时代的变化 |
|---|---|---|---|
| 分类 | 判断属于哪一类 | LR、SVM、GBDT、CNN | 文本分类被 LLM 统一为「生成分类标签」 |
| 回归 | 预测连续值 | 线性回归、GBDT、MLP | 数值预测仍以传统模型为主 |
| 排序(Ranking) | 给候选集排优先级 | GBDT/LambdaMART、DSSM | 推荐/搜索用 LLM 做召回与精排增强 |
| 检测 | 定位 + 分类物体 | Faster R-CNN、YOLO | 被 VLM 的 grounding 能力部分取代 |
| 分割 | 像素级语义标注 | U-Net、Mask R-CNN | 仍是视觉专用任务 |
| 生成 | 创造新内容 | GAN、VAE、Diffusion、LLM | 文本/图像生成全面 LLM/扩散化 |
| 检索 | 找出相关项 | BM25、向量检索、双塔 | RAG 把检索变成了 LLM 的标准组件 |
| 对话 | 多轮交互 | Seq2Seq、DialogGPT | 对话 = LLM 最主流的落地面 |
最关键的观察:LLM 正在把「任务」收敛成「生成」。过去十几种任务类型、十几种输出头、十几种损失函数,如今在 LLM 里统一为「生成一段 token」。但这不意味着其他任务消失了——凡是需要低延迟、高精度、确定性强的场景(排序、风控、时序),传统任务模型依然更优。选型时先问任务性质,再问模型能力。
2.4 按结构:从线性模型到生成式网络
2.4.1 传统结构:线性、树、集成、核、贝叶斯
- 线性模型:LR、线性回归。简单、可解释、训练快,适合高维稀疏特征(广告、风控)。
- 树模型:决策树、随机森林、GBDT/XGBoost/LightGBM。统治结构化表格数据,对特征尺度不敏感、能捕捉非线性、自带特征重要度。
- 集成模型:Bagging(RF)降方差,Boosting(GBDT)降偏差,Stacking 组合异构模型。
- 核方法:SVM。小样本、高维空间分类效果好,但难扩展到大数据。
- 贝叶斯模型:朴素贝叶斯、贝叶斯网络、高斯过程。天然带不确定性估计,适合小数据与需要置信区间的场景。
工程选型铁律:结构化表格数据优先 GBDT,非结构化数据(文本、图像、语音)优先神经网络/LLM。 这个「两段论」在 LLM 时代依然成立,第 24 章的案例会给出完整论证。
2.4.2 神经网络家族
- MLP(多层感知机):最基础的神经网络,适合中等规模表格与特征交互,是一切深度结构的基础件。
- CNN(卷积神经网络):局部连接 + 权值共享 + 平移不变性,是视觉任务的默认选择,也用于文本(TextCNN)。
- RNN/LSTM:处理序列的经典结构,串行计算、难以并行、长程依赖弱,已被 Transformer 取代(第 3 章详述原因)。
- Transformer:自注意力 + 并行计算,统治文本、并扩展到视觉(ViT)与多模态。第 3 章主角。
- GNN(图神经网络):处理图结构数据(社交网络、分子、知识图谱),与 LLM 结合构成 GraphRAG(第 17 章)。
- Diffusion(扩散模型):图像/视频生成的主流(Stable Diffusion、Sora),通过逐步去噪生成样本。
- GAN(生成对抗网络):生成器 + 判别器对抗训练,图像生成与风格迁移,训练不稳定,已被 Diffusion 部分取代。
- VAE(变分自编码器):概率生成模型,隐空间连续,用于表示学习与生成。
一张图看结构演进与「谁取代了谁」:
%%{init: {"themeVariables": {"primaryTextColor": "#000000", "textColor": "#000000", "labelColor": "#000000", "nodeTextColor": "#000000", "labelTextColor": "#000000", "scaleLabelColor": "#000000"}}}%%
graph LR
A[线性/树/核/贝叶斯] -->|表格数据仍在用| B[MLP]
B --> C[CNN]
B --> D[RNN/LSTM]
C --> E[Transformer]
D -->|序列建模被取代| E
E --> F[Encoder-only BERT]
E --> G[Decoder-only GPT]
E --> H[Encoder-Decoder T5]
E --> I[Diffusion/GAN 视觉生成]2.4.3 LLM 架构三兄弟:Encoder-only、Decoder-only、Encoder-Decoder
Transformer 家族分三条技术路线,它们的区别决定了「能做什么、怎么训练、怎么用」:
| 架构 | 代表作 | 训练目标 | 特点 | 适合任务 |
|---|---|---|---|---|
| Encoder-only | BERT、RoBERTa | MLM(掩码语言建模) | 双向上下文,理解强 | 分类、NER、检索、句子相似度 |
| Decoder-only | GPT、Llama、Qwen | CLM(下一个词预测) | 自回归生成,生成强 | 文本生成、对话、Agent |
| Encoder-Decoder | T5、BART | Span Corruption / 去噪 | 编码理解 + 解码生成 | 翻译、摘要、受控生成 |
Decoder-only 为什么胜出:2020 年代初三种架构并存,最终 Decoder-only 几乎一统江湖(GPT、Llama、Qwen、DeepSeek 全是)。原因有三:
- 任务统一:任何任务都能表达为「给定前缀生成后缀」,理解任务也可以靠生成解决;
- 训练简单:CLM 目标天然自监督,无需像 MLM 那样构造掩码标签;
- 规模化稳定:自回归结构与推理时的 KV Cache 天然契合,长上下文扩展(RoPE、位置插值)也主要围绕 Decoder-only 展开。
但这不意味着 Encoder-only 死了——在检索(嵌入模型如 BGE、E5)、分类、NER 等「理解型」任务上,双向编码模型仍然效率更高、更省。第 3 章会深入 Decoder-only 的内部机理。
2.5 按模态:文本、图像、语音、视频、表格、时序、图、多模态
模态决定数据的「感官类型」,也决定了模型结构的选择:
| 模态 | 数据结构 | 主流模型 | 与 LLM 的关系 |
|---|---|---|---|
| 文本 | token 序列 | LLM、BERT | LLM 主场 |
| 图像 | 像素矩阵 | CNN、ViT、Diffusion | VLM 把图像编码接入 LLM |
| 语音 | 波形/频谱 | Whisper、Conformer | ASR + LLM 构成语音助手 |
| 视频 | 帧序列 | VideoMAE、Sora | 视频理解/生成 |
| 表格 | 结构化字段 | GBDT、TabNet | LLM 直接处理效果一般 |
| 时序 | 等间隔观测 | LSTM、TCN、TimesNet | 专业时序模型仍优于通用 LLM |
| 图 | 节点+边 | GNN | GraphRAG 结合 |
| 多模态 | 混合 | CLIP、GPT-4o、Qwen-VL | 趋势所在 |
2.5.1 多模态是终局
单模态模型各自为政的时代正在结束。以 GPT-4o、Gemini、Qwen-VL 为代表的多模态 LLM 将文本、图像、音频统一到一个模型中:图像经视觉编码器(ViT/CLIP)转成视觉 token,与文本 token 一起进入 Transformer;输出可以是文本或图像。第 25 章的多模态案例会展开。
但**「多模态」不等于「所有任务都用多模态大模型」**:OCR、人脸识别、工业质检这类对精度和延迟要求极高的专用任务,专业小模型依然更合适。多模态 LLM 接管的是「理解 + 交互」类任务,专业模型接管的是「精准 + 实时」类任务。
2.6 按规模:小模型、中模型、大模型、基础模型、边缘模型
规模是本书最核心的变量之一(第 4 章专题展开),这里先建立直觉:
| 规模档位 | 参数量 | 部署形态 | 典型用途 |
|---|---|---|---|
| 边缘模型 | <1B | 手机、浏览器、端侧 | 离线小助手、语音识别 |
| 小模型 | 1B-7B | 单卡/小集群 | 垂直任务微调、低成本服务 |
| 中模型 | 7B-70B | 单机多卡 | 通用任务、RAG、Agent 主干 |
| 大模型 | 70B-500B | 多机集群 | 高能力需求、旗舰服务 |
| 基础模型 | >500B | 万卡预训练 | 开源底座、闭源旗舰 |
两个重要概念:
- 模型大小 ≠ 能力大小:7B 模型通过蒸馏、微调、RAG 在垂直场景上可能优于通用 70B 模型。规模是能力杠杆之一,不是全部(呼应第 1 章「涌现的争议」)。
- 边缘模型 = 大模型的蒸馏产物:端侧模型(如 Llama 3.2 1B/3B、Qwen 1.5B)大多由大模型蒸馏而来,牺牲部分能力换取隐私、离线、低延迟。第 13 章蒸馏、第 18 章端侧部署展开。
2.7 按部署形态:在线、离线、流式、端侧
| 部署形态 | 延迟要求 | 特点 | 典型场景 |
|---|---|---|---|
| 在线(同步) | ms-秒级 | 实时推理、高可用 | 对话、搜索、推荐 |
| 离线(批处理) | 分钟-小时 | 吞吐优先、成本低 | 数据标注、批量打标、离线评估 |
| 流式 | 首个 token 快 | 边生成边输出 | 流式对话、直播字幕 |
| 端侧 | 本地即时 | 隐私、离线、低功耗 | 手机助手、车机 |
部署形态直接决定服务架构:在线服务要 GPU 集群 + 弹性伸缩(第 16 章),离线批处理用队列 + 批推理(第 15 章),端侧要量化 + 剪枝(第 13、18 章)。同一个模型,不同部署形态的工程复杂度天差地别——这是「全生命周期」视角最容易被忽略的维度。
2.8 选型决策框架:面对业务,选什么模型?
把六个维度收拢成一个决策流程:
%%{init: {"themeVariables": {"primaryTextColor": "#000000", "textColor": "#000000", "labelColor": "#000000", "nodeTextColor": "#000000", "labelTextColor": "#000000", "scaleLabelColor": "#000000"}}}%%
flowchart TD
A[业务问题] --> B{数据模态?}
B -->|结构化表格| C[GBDT/树模型
低延迟高精度]
B -->|非结构化文本| D{任务类型?}
B -->|图像/视频| E{精度 vs 泛化?}
D -->|分类/NER/检索| F[Encoder-only 或
小 LLM + 微调]
D -->|生成/对话/开放任务| G[Decoder-only LLM]
E -->|高精度实时| H[专用 CNN/ViT]
E -->|开放理解交互| I[VLM 多模态 LLM]
C --> J{延迟与成本约束}
F --> J
G --> J
J -->|极严| K[小模型+蒸馏+量化]
J -->|一般| L[中/大模型+推理优化]
J -->|宽松| M[旗舰大模型]核心决策变量排序:模态 → 任务 → 规模/成本 → 延迟 → 数据可得性。而「数据可得性」是 LLM 时代的新变量——如果业务有高质量标注数据,微调小模型可能优于调用闭源大模型;如果没有数据,直接上大模型 + RAG 更现实。
本章要点回顾
- 任何模型都能用「学习范式、任务、结构、模态、规模、部署形态」六个维度定位。
- 学习范式五种:监督、无监督、自监督、半监督、强化学习;LLM 生命周期把它们全串了起来。
- 任务正在被 LLM「收敛成生成」,但排序、风控、时序等确定性任务仍是传统模型的天下。
- 表格数据用 GBDT,非结构化数据用神经网络/LLM——这个铁律依然成立。
- Decoder-only 因任务统一、训练简单、规模化稳定而胜出;Encoder-only 在理解型任务上仍有价值。
- 多模态是趋势,但「精准+实时」任务仍归专用小模型。
- 规模是能力杠杆但不是全部;部署形态决定工程复杂度。
习题
- 给「人脸识别闸机」这个业务,按六维度贴标签,并说明每个维度的选型理由。
- 为什么 Decoder-only 在 LLM 竞赛中胜出?试着从训练目标、推理效率、规模化三个角度论证。
- 一个电商搜索业务:query 匹配用 Encoder-only,生成式推荐语用 Decoder-only。为什么这样分工?有没有更好的方案?
- 时序预测(如销量预测)用 LLM 还是专业时序模型?说出你的判断和判断依据。
延伸阅读
- Devlin et al., BERT: Pre-training of Deep Bidirectional Transformers, 2019
- Raffel et al., Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer(T5), 2020
- Radford et al., Language Models are Unsupervised Multitask Learners, 2019
- Dosovitskiy et al., An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale(ViT), 2021
- 推荐阅读 GBDT 三件套:XGBoost(Chen & Guestrin, 2016)、LightGBM(Ke et al., 2017)
下一章预告
第 3 章深入 Decoder-only 内部:Token 化、Embedding、位置编码、自注意力、KV Cache,把 LLM 这台机器的每一个核心零件拆开看。