第 25 章 LLM多模态VLM

第 25 章 案例:视觉/语音/多模态

第 25 章 案例:视觉/语音/多模态

学习目标

  • 理解图像(分类/检测/分割/OCR)、语音(识别/合成)、多模态(检索/生成/理解)的模型与工程;
  • 理解多模态大模型(VLM)的架构与工程化;
  • 理解「多模态大模型 vs 专业小模型」的分工(呼应第 2 章选型);
  • 把生命周期方法论套用到多模态场景。

25.1 视觉:分类、检测、分割、OCR

视觉四类任务,模型与工程差异明显:

任务 干什么 主流模型 工程特点
图像分类 整图类别 CNN(ResNet)、ViT 最简单、成熟
目标检测 定位 + 分类 YOLO、DETR 后处理(NMS)复杂
分割 像素级标注 U-Net、Mask R-CNN 计算重、标注贵
OCR 文字识别 PaddleOCR、TrOCR 版面分析 + 识别串联

视觉工程的经典流程:数据(采集+标注,第 6 章)→ 训练(CNN/ViT,第 7 章)→ 压缩(INT8 量化很成熟,第 13 章)→ 服务(Triton,第 16 章)→ 监控(精度漂移,第 22 章)。视觉是「传统模型生产化」最成熟的领域——生命周期方法论在这里跑得最顺。

视觉场景的 LLM 冲击:VLM 让「看懂图 + 对话」成为可能,但工业质检、安全监控这类「精准 + 实时 + 可解释」任务仍是专业小模型的天下(第 2 章判断)。OCR 是例外中的例外——VLM 的 OCR 能力已很强,很多场景直接交给 VLM。

25.2 语音:识别与合成

任务 干什么 主流模型 工程特点
ASR(识别) 语音转文本 Whisper、Conformer 流式 vs 离线、方言
TTS(合成) 文本转语音 VITS、CosyVoice 音色、延迟、情感

语音工程的独特问题

  • 流式 vs 非流式:实时语音助手要流式 ASR(边说边识别,首个词快),离线转写可以整段(准确率高)——第 15 章在线/离线的语音版;
  • 音频是时序信号:采样率、降噪、VAD(语音活动检测)等预处理是工程大头;
  • 语音 + LLM 组合:ASR(转文本)→ LLM(理解/生成)→ TTS(朗读)——现代语音助手的标准流水线。语音的 LLM 化(直接语音进语音出,如 GPT-4o)正在发生,但延迟与稳定性仍是难点。

25.3 多模态大模型(VLM):架构与工程

VLM(视觉语言模型)是把视觉编码 + LLM 统一起来的架构(第 2 章提过):

%%{init: {"themeVariables": {"primaryTextColor": "#000000", "textColor": "#000000", "labelColor": "#000000", "nodeTextColor": "#000000", "labelTextColor": "#000000", "scaleLabelColor": "#000000"}}}%%
flowchart LR
    A[图像] --> B[视觉编码器
ViT/CLIP] B -->|视觉 token| C[投影层
Q-Former/MLP] C --> D[LLM 主干
Qwen-VL/Llama-Vision] E[文本] --> D D --> F[文本/多模态输出]

VLM 的三段式(Qwen-VL、LLaVA、Llama 3.2 Vision 同构):

  1. 视觉编码器:把图切成 patch 编码成视觉 token(ViT);
  2. 投影层:把视觉 token 映射到 LLM 的词向量空间(对齐两种模态);
  3. LLM 主干:把视觉 token + 文本 token 一起自回归生成。

VLM 的工程注意点

  • 视觉 token 数量爆炸:一张 224² 图就切出几百个视觉 token——高分辨率图像会吃掉大量上下文与 KV(第 4 章账);工程解法:动态分辨率、视觉 token 压缩(第 26 章会再遇到);
  • 训练分阶段:先对齐(图像-文本配对,第 6 章 CLIP 类数据)→ 再指令微调 → 再 RLHF(多模态偏好);
  • 评测:第 9 章能力基准的视觉版(MMMU、MathVista、DocVQA、OCRBench)——VLM 的评测比纯文本更碎,长尾能力(图表推理、版面理解)差异大。

25.4 多模态检索、图文生成、视频理解

  • 多模态检索:图文互相检索(CLIP 把图/文映射到同一空间)——RAG 的视觉版(第 17 章):「给我找长得像这张图的图」「用图搜商品」;
  • 图文生成:文生图(Diffusion,第 2 章)已经是成熟产品(Stable Diffusion、Midjourney);图生图、可控生成(ControlNet);
  • 视频理解:视频 = 帧序列,比图像多「时间维」——计算量大一个量级,工程上要先抽帧降采样再理解(第 20 章边缘协同、第 14 章推理优化的视频版)。
%%{init: {"themeVariables": {"primaryTextColor": "#000000", "textColor": "#000000", "labelColor": "#000000", "nodeTextColor": "#000000", "labelTextColor": "#000000", "scaleLabelColor": "#000000"}}}%%
flowchart LR
    A[视觉/语音/多模态应用] --> B{任务性质}
    B -->|精准实时| C[专业小模型
检测/分割/ASR] B -->|开放理解交互| D[VLM 大模型
看图问答/助手] B -->|内容生成| E[扩散模型
文生图/视频] C -.作为工具.-> D E -.生成内容喂给.-> D

25.5 多模态的生命周期特殊点

把全书方法论套到多模态,几处「平移」:

  • 数据(第 6 章):多模态数据配对难(图-文对齐、清洗质量差)、标注贵——合成数据(第 6 章)在多模态更关键;
  • 压缩(第 13 章):视觉模型的 INT8 量化很成熟;VLM 的视觉编码器也可以量化,但精度敏感;
  • 推理(第 14 章):视觉 token 多 → KV 压力大 → 视觉 token 压缩是 VLM 推理优化的主战场;
  • 部署(第 18 章):端侧视觉(人脸、OCR)成熟;端侧 VLM 正在出现(量化到 1-3B);
  • 安全(第 23 章):多模态的越狱(把恶意指令藏在图像里)是新兴攻击面——提示注入的第 25 章版

本章要点回顾

  1. 视觉是传统模型生产化最成熟领域;精准实时任务仍归专业小模型,OCR 已大量交给 VLM。
  2. 语音工程特色:流式 vs 非流式、预处理管线、ASR→LLM→TTS 流水线。
  3. VLM = 视觉编码 + 投影对齐 + LLM 主干;视觉 token 爆炸是推理大头。
  4. 多模态检索(CLIP)、图文生成(Diffusion)、视频理解(抽帧+理解)是三大应用。
  5. 多模态生命周期特殊点:配对数据难、视觉 token 压缩、多模态注入是新攻击面。

习题

  1. 设计一个「拍照识物 + 讲解」的 VLM 应用:视觉编码、上下文管理、端侧还是云端、成本估算。
  2. OCR 场景,VLM vs 专业 OCR 怎么选?给出决策树(精度、速度、成本、版面复杂度)。
  3. 一张 1024² 图经 ViT 切成多少视觉 token?会对 128K 上下文造成多大压力?估算。
  4. 设计多模态提示注入的防御:攻击者把指令写在图片角落,如何检测?

延伸阅读

  • Li et al., LLaVA: Visual Instruction Tuning, 2023
  • Bai et al., Qwen-VL: A Versatile Vision-Language Model, 2023
  • Radford et al., Learning Transferable Visual Models From Natural Language Supervision(CLIP), 2021
  • Rombach et al., High-Resolution Image Synthesis with Latent Diffusion Models, 2022
  • 多模态评测基准(MMMU、MathVista、DocVQA、OCRBench)

下一章预告

第 26 章 LLM 与 Agent:从预训练到对齐的完整案例、RAG 服务与 Agent 平台、多租户 LLM 服务与成本优化、安全合规评测。