第 28 章 LLM趋势MoE
第 28 章 未来趋势
第 28 章 未来趋势
学习目标
- 理解「更大 vs 更小」的路线之争与各自的工程含义;
- 理解 MoE、多模态、Agent、世界模型的演进方向;
- 理解端侧 AI、联邦学习、隐私计算的趋势;
- 理解绿色 AI 与可持续计算;
- 展望自动化 MLOps/LLMOps。
28.1 更大 vs 更小:路线的分岔
第 4 章的规模账推到这里,两条路线已经清晰:
%%{init: {"themeVariables": {"primaryTextColor": "#000000", "textColor": "#000000", "labelColor": "#000000", "nodeTextColor": "#000000", "labelTextColor": "#000000", "scaleLabelColor": "#000000"}}}%%
flowchart LR
A[规模路线] --> B[更大
旗舰/万卡/通用天花板]
A --> C[更小
端侧/专用/效率]
B --> D[强能力
高成本]
C --> E[低延迟低成本
专用场景]
D -.蒸馏/合成数据.-> C- 更大路线:MoE 化(第 4 章)让「总参数万亿、激活百亿」成为主流——规模与效率兼得;旗舰模型继续统治复杂推理与 Agent 底座;
- 更小路线:蒸馏 + 量化 + 端侧(第 13、18 章)让「够用的小模型」统治高频低延迟场景;
- 结论不是二选一:大模型负责「能力的上限」,小模型负责「成本的底线」,中间靠蒸馏与路由连接(第 26 章「路由 + 压缩」的规模化)——这是全书的选型哲学在趋势层面的收束。
28.2 MoE、多模态、Agent、世界模型
四大方向,每个都是本书某个主题的「进化」:
| 方向 | 现状(2026) | 工程挑战 | 本书对应 |
|---|---|---|---|
| MoE | 旗舰标配(DeepSeek-V3 等) | 存储 1.3TB、EP 通信 | 第 4、10、20 章 |
| 多模态 | VLM 成默认(第 25 章) | 视觉 token 爆炸 | 第 25 章 |
| Agent | 从玩具到生产 | 可靠性、成本、安全 | 第 17、26 章 |
| 世界模型 | 视频生成 + 规划 | 算力、评测 | 第 25 章 |
- MoE 的下一步:细粒度专家、共享专家、更高效的 all-to-all(第 4 章 DeepSeek-V3 的 1.8 倍激活效率)——推理侧 EP 的通信优化是下一个主战场;
- 多模态的下一步:统一「理解 + 生成」的双向模型(既能看也能画),音频视频进同一 token 空间——KV 与上下文管理(第 14 章)继续承压;
- Agent 的下一步:多 Agent 协作、长期记忆、自主规划——可靠性(循环控制、权限、评测)是量产的门槛(第 26 章),不是模型能力;
- 世界模型:用视频理解「物理世界」——训练数据(视频)与评测(物理一致性)是最大难点。
28.3 端侧 AI、联邦学习、隐私计算
端侧 AI 的成熟曲线(第 18 章):
- 端侧从「语音唤醒」走向「端侧 LLM/VLM」:1B-7B 量化模型进手机、PC、车机;
- 端云协同成为默认架构:端侧即时响应 + 云端深度能力(第 20 章分层推理);
- 联邦学习与隐私计算(第 7、23 章):数据不出域训「公共模型」——LoRA 联邦是现实路径(通信量小,第 7 章)。
趋势判断:端侧 AI 的瓶颈不是模型(够小了),是应用生态与工具链(端侧推理框架、内存管理、OTA 模型更新)——这是工程机会。
28.4 绿色 AI、可持续计算
第 4 章的能耗账:训练一个旗舰模型 = 数千吨碳排放,推理的持续性消耗更大(第 11 章「推理是持续性大头」)。绿色 AI 的三个工程抓手:
- 效率优先:MFU 优化(第 11 章)= 省电;量化(第 13 章)= 省显存省带宽;
- 算力调度:用「低碳时段 + 绿色能源」跑训练(第 12 章调度的能源维度);
- 更少地算:蒸馏小模型替代大模型(第 13 章)、缓存命中减少重复计算(第 16 章)、模型路由不浪费算力(第 15 章)。
绿色 AI 的商业化动力:能耗 = 成本。可持续计算与降本在工程上是一件事——这不是道德选择,是经营选择。
28.5 自动化 MLOps/LLMOps
第 5 章定义过 MLOps/LLMOps,趋势是「自动化」:
| 阶段 | 现状 | 自动化方向 |
|---|---|---|
| 数据 | 人工清洗 + 规则 | 自动质量检测、自动合成、自动配比 |
| 训练 | 人工调参 | AutoML、自动并行配置 |
| 评估 | 人工评测 + 裁判模型 | 自动在线评估、自动回归门禁 |
| 部署 | 人工发布 | 自动金丝雀、自动回滚 |
| 监控 | 人工设告警 | 自动漂移检测、自动触发 CT |
| 治理 | 人工文档 | 自动模型卡、自动审计 |
%%{init: {"themeVariables": {"primaryTextColor": "#000000", "textColor": "#000000", "labelColor": "#000000", "nodeTextColor": "#000000", "labelTextColor": "#000000", "scaleLabelColor": "#000000"}}}%%
flowchart LR
A[数据自动管线] --> B[自动 CT]
B --> C[自动评估门禁]
C --> D[自动发布+金丝雀]
D --> E[自动监控+漂移检测]
E -->|触发| A自动化 ≠ 无人化:每个环节的自动化都建立在「第 5-23 章的方法论」之上(没有评估门禁就自动化发布是灾难)。LLMOps 的终极形态是「模型生命周期闭环自动旋转」——数据变 → 模型自动跟 → 发布自动走 → 质量自动验——这本书讲的每一步,都是这个闭环上可自动化的点。
28.6 收束:全生命周期工程的一贯之道
回顾全书,28 章讲的是同一件事的不同侧面:
模型的真正价值不在「训练出一个好模型」,而在「让模型在整个生命周期里持续、稳定、合规地创造价值」——从数据到预训练到对齐到评估,从分布式训练到压缩到推理到服务,从部署到监控到治理。
几个贯穿始终的判断(也是本书的「中心思想」):
- 概念不变,规模变了(第 1 章):所有工程问题的本质,在 LLM 时代只是规模与约束不同;
- 权衡思维:显存 vs 速度(第 8 章)、能力 vs 成本(第 4 章)、延迟 vs 吞吐(第 14 章)、可靠 vs 成本(第 20 章)——没有免费午餐,只有清醒的取舍;
- 闭环思维:监控 → 数据 → 训练 → 发布 → 再监控(第 5、22 章)——模型是活的生命,不是一次性产物;
- 治理是底线:安全、隐私、合规不是附加项,是流程的一等公民(第 23 章)。
本章要点回顾
- 更大 vs 更小不是二选一:大模型管上限、小模型管成本、蒸馏与路由连接两端。
- MoE、多模态、Agent、世界模型四大方向,工程挑战分别是 EP 通信、视觉 token、可靠性、评测。
- 端侧 AI 的瓶颈在生态与工具链;端云协同是默认架构。
- 绿色 AI 与降本是一件事:MFU、量化、缓存、路由都是可持续计算。
- 自动化 LLMOps 让生命周期闭环自动旋转,但每个自动化点都建立在方法论之上。
- 全书中心思想:概念不变规模变了、权衡思维、闭环思维、治理是底线。
习题
- 三年后你的应用还会用「通用大模型」吗?画出「大-中-小」模型的分工图。
- Agent 量产的最大障碍是模型能力还是工程可靠性?给出论据。
- 设计一个「绿色 AI」改造方案:把现有推理服务降碳 30%,列出可落地的 5 个动作与预估收益。
- 你的团队要上「自动 CT + 自动发布」,列出必须先具备的 5 个前置条件(防自动化灾难)。
延伸阅读
- DeepSeek-V3 / Llama 3 技术报告(MoE 与基础设施趋势)
- Anthropic / OpenAI / Google 的模型路线图文章
- 各厂商端侧 AI 白皮书(Apple Intelligence、端侧 VLM)
- 绿色 AI 报告(MLPerf 能效、各云厂商碳核算)
- LangChain / LangGraph 的 Agent 未来展望
全书结语
到这里,28 章全部讲完。这本书从「模型是什么」讲到「模型怎么造」,从「造出来之后怎么跑」讲到「跑起来之后怎么管」,最后落到「接下来往哪走」。附录 A-J 提供数学基础、工具链、术语表与四张检查清单,供实战查阅。
愿你的每个模型,都能走完它完整、健康、受治理的一生。