第 28 章 LLM趋势MoE

第 28 章 未来趋势

第 28 章 未来趋势

学习目标

  • 理解「更大 vs 更小」的路线之争与各自的工程含义;
  • 理解 MoE、多模态、Agent、世界模型的演进方向;
  • 理解端侧 AI、联邦学习、隐私计算的趋势;
  • 理解绿色 AI 与可持续计算;
  • 展望自动化 MLOps/LLMOps。

28.1 更大 vs 更小:路线的分岔

第 4 章的规模账推到这里,两条路线已经清晰:

%%{init: {"themeVariables": {"primaryTextColor": "#000000", "textColor": "#000000", "labelColor": "#000000", "nodeTextColor": "#000000", "labelTextColor": "#000000", "scaleLabelColor": "#000000"}}}%%
flowchart LR
    A[规模路线] --> B[更大
旗舰/万卡/通用天花板] A --> C[更小
端侧/专用/效率] B --> D[强能力
高成本] C --> E[低延迟低成本
专用场景] D -.蒸馏/合成数据.-> C
  • 更大路线:MoE 化(第 4 章)让「总参数万亿、激活百亿」成为主流——规模与效率兼得;旗舰模型继续统治复杂推理与 Agent 底座;
  • 更小路线:蒸馏 + 量化 + 端侧(第 13、18 章)让「够用的小模型」统治高频低延迟场景;
  • 结论不是二选一大模型负责「能力的上限」,小模型负责「成本的底线」,中间靠蒸馏与路由连接(第 26 章「路由 + 压缩」的规模化)——这是全书的选型哲学在趋势层面的收束。

28.2 MoE、多模态、Agent、世界模型

四大方向,每个都是本书某个主题的「进化」:

方向 现状(2026) 工程挑战 本书对应
MoE 旗舰标配(DeepSeek-V3 等) 存储 1.3TB、EP 通信 第 4、10、20 章
多模态 VLM 成默认(第 25 章) 视觉 token 爆炸 第 25 章
Agent 从玩具到生产 可靠性、成本、安全 第 17、26 章
世界模型 视频生成 + 规划 算力、评测 第 25 章
  • MoE 的下一步:细粒度专家、共享专家、更高效的 all-to-all(第 4 章 DeepSeek-V3 的 1.8 倍激活效率)——推理侧 EP 的通信优化是下一个主战场
  • 多模态的下一步:统一「理解 + 生成」的双向模型(既能看也能画),音频视频进同一 token 空间——KV 与上下文管理(第 14 章)继续承压;
  • Agent 的下一步:多 Agent 协作、长期记忆、自主规划——可靠性(循环控制、权限、评测)是量产的门槛(第 26 章),不是模型能力;
  • 世界模型:用视频理解「物理世界」——训练数据(视频)与评测(物理一致性)是最大难点。

28.3 端侧 AI、联邦学习、隐私计算

端侧 AI 的成熟曲线(第 18 章):

  • 端侧从「语音唤醒」走向「端侧 LLM/VLM」:1B-7B 量化模型进手机、PC、车机;
  • 端云协同成为默认架构:端侧即时响应 + 云端深度能力(第 20 章分层推理);
  • 联邦学习与隐私计算(第 7、23 章):数据不出域训「公共模型」——LoRA 联邦是现实路径(通信量小,第 7 章)。

趋势判断:端侧 AI 的瓶颈不是模型(够小了),是应用生态与工具链(端侧推理框架、内存管理、OTA 模型更新)——这是工程机会。

28.4 绿色 AI、可持续计算

第 4 章的能耗账:训练一个旗舰模型 = 数千吨碳排放,推理的持续性消耗更大(第 11 章「推理是持续性大头」)。绿色 AI 的三个工程抓手:

  1. 效率优先:MFU 优化(第 11 章)= 省电;量化(第 13 章)= 省显存省带宽;
  2. 算力调度:用「低碳时段 + 绿色能源」跑训练(第 12 章调度的能源维度);
  3. 更少地算:蒸馏小模型替代大模型(第 13 章)、缓存命中减少重复计算(第 16 章)、模型路由不浪费算力(第 15 章)。

绿色 AI 的商业化动力:能耗 = 成本。可持续计算与降本在工程上是一件事——这不是道德选择,是经营选择。

28.5 自动化 MLOps/LLMOps

第 5 章定义过 MLOps/LLMOps,趋势是「自动化」:

阶段 现状 自动化方向
数据 人工清洗 + 规则 自动质量检测、自动合成、自动配比
训练 人工调参 AutoML、自动并行配置
评估 人工评测 + 裁判模型 自动在线评估、自动回归门禁
部署 人工发布 自动金丝雀、自动回滚
监控 人工设告警 自动漂移检测、自动触发 CT
治理 人工文档 自动模型卡、自动审计
%%{init: {"themeVariables": {"primaryTextColor": "#000000", "textColor": "#000000", "labelColor": "#000000", "nodeTextColor": "#000000", "labelTextColor": "#000000", "scaleLabelColor": "#000000"}}}%%
flowchart LR
    A[数据自动管线] --> B[自动 CT]
    B --> C[自动评估门禁]
    C --> D[自动发布+金丝雀]
    D --> E[自动监控+漂移检测]
    E -->|触发| A

自动化 ≠ 无人化:每个环节的自动化都建立在「第 5-23 章的方法论」之上(没有评估门禁就自动化发布是灾难)。LLMOps 的终极形态是「模型生命周期闭环自动旋转」——数据变 → 模型自动跟 → 发布自动走 → 质量自动验——这本书讲的每一步,都是这个闭环上可自动化的点。

28.6 收束:全生命周期工程的一贯之道

回顾全书,28 章讲的是同一件事的不同侧面:

模型的真正价值不在「训练出一个好模型」,而在「让模型在整个生命周期里持续、稳定、合规地创造价值」——从数据到预训练到对齐到评估,从分布式训练到压缩到推理到服务,从部署到监控到治理。

几个贯穿始终的判断(也是本书的「中心思想」):

  1. 概念不变,规模变了(第 1 章):所有工程问题的本质,在 LLM 时代只是规模与约束不同;
  2. 权衡思维:显存 vs 速度(第 8 章)、能力 vs 成本(第 4 章)、延迟 vs 吞吐(第 14 章)、可靠 vs 成本(第 20 章)——没有免费午餐,只有清醒的取舍
  3. 闭环思维:监控 → 数据 → 训练 → 发布 → 再监控(第 5、22 章)——模型是活的生命,不是一次性产物
  4. 治理是底线:安全、隐私、合规不是附加项,是流程的一等公民(第 23 章)。

本章要点回顾

  1. 更大 vs 更小不是二选一:大模型管上限、小模型管成本、蒸馏与路由连接两端。
  2. MoE、多模态、Agent、世界模型四大方向,工程挑战分别是 EP 通信、视觉 token、可靠性、评测。
  3. 端侧 AI 的瓶颈在生态与工具链;端云协同是默认架构。
  4. 绿色 AI 与降本是一件事:MFU、量化、缓存、路由都是可持续计算。
  5. 自动化 LLMOps 让生命周期闭环自动旋转,但每个自动化点都建立在方法论之上。
  6. 全书中心思想:概念不变规模变了、权衡思维、闭环思维、治理是底线。

习题

  1. 三年后你的应用还会用「通用大模型」吗?画出「大-中-小」模型的分工图。
  2. Agent 量产的最大障碍是模型能力还是工程可靠性?给出论据。
  3. 设计一个「绿色 AI」改造方案:把现有推理服务降碳 30%,列出可落地的 5 个动作与预估收益。
  4. 你的团队要上「自动 CT + 自动发布」,列出必须先具备的 5 个前置条件(防自动化灾难)。

延伸阅读

  • DeepSeek-V3 / Llama 3 技术报告(MoE 与基础设施趋势)
  • Anthropic / OpenAI / Google 的模型路线图文章
  • 各厂商端侧 AI 白皮书(Apple Intelligence、端侧 VLM)
  • 绿色 AI 报告(MLPerf 能效、各云厂商碳核算)
  • LangChain / LangGraph 的 Agent 未来展望

全书结语

到这里,28 章全部讲完。这本书从「模型是什么」讲到「模型怎么造」,从「造出来之后怎么跑」讲到「跑起来之后怎么管」,最后落到「接下来往哪走」。附录 A-J 提供数学基础、工具链、术语表与四张检查清单,供实战查阅。

愿你的每个模型,都能走完它完整、健康、受治理的一生。