🧠

大模型训练演示

八个动画场景,看懂一个 LLM 从原始数据到上线服务的完整旅程。自动轮播,也可点击切换或用 ← → 键浏览。

01 / 08
数据层

从互联网收集万亿 Token

训练的第一步是"喂数据"。网络爬虫、书籍、代码仓库、学术论文汇成原始语料库(corpus),规模直接决定模型能力的上限。

  • GPT-3 使用约 300B token,Llama 3 达 15T+ token
  • 网页(Common Crawl)通常占大头,代码数据对推理能力帮助显著
  • 数据质量比数量更关键——"垃圾进,垃圾出"(Garbage in, garbage out)
🌐Web📚Books💻Code📄Papers💬ForumsRaw Corpus15T tokens
Data Collection
1 / 8

全流程一览

动画仅为示意,真实训练管线各有差异(如 DeepSeek 使用 GRPO、Llama 3 采用多轮后训练)。