🧠
大模型训练演示
八个动画场景,看懂一个 LLM 从原始数据到上线服务的完整旅程。自动轮播,也可点击切换或用 ← → 键浏览。
01 / 08
数据层
从互联网收集万亿 Token
训练的第一步是"喂数据"。网络爬虫、书籍、代码仓库、学术论文汇成原始语料库(corpus),规模直接决定模型能力的上限。
- GPT-3 使用约 300B token,Llama 3 达 15T+ token
- 网页(Common Crawl)通常占大头,代码数据对推理能力帮助显著
- 数据质量比数量更关键——"垃圾进,垃圾出"(Garbage in, garbage out)
Data Collection
1 / 8
全流程一览
动画仅为示意,真实训练管线各有差异(如 DeepSeek 使用 GRPO、Llama 3 采用多轮后训练)。