1. LLM 领域全景图
学习目标
- 画出 LLM 从数据到服务的生命周期
- 区分 Base、Chat 与 Reasoning Model
- 理解模型能力不由参数量单独决定
前置知识
- 完成导学章节
本章产物用自己的话讲解六阶段生命周期,并为每阶段列出一个可观测指标。
1.1 一个 LLM 从出生到服务
01 MODEL BUILD
-
01数据准备
原始数据 → 训练语料
- 来源许可与数据治理
- 去重、过滤与脱敏
- 质量评分与数据配比
-
02Tokenizer
文本 → token ID
- 构建或选择词表
- 编码与解码文本
- 确定序列长度与成本
-
03预训练
Next-token Prediction
- 学习语言与世界知识
- 优化训练 loss
- 产出 Base Model
BASE MODEL
进入行为塑造、能力验证与产品化阶段
02 PRODUCT LOOP
-
04后训练
Base Model → 候选模型
- SFT 学习指令与格式
- DPO、RLHF 等偏好优化
- 安全与领域适配
-
05评估
候选模型 → 发布决策
- 能力、业务任务与安全红队
- 人工评估与回归测试
- 延迟、吞吐、内存与成本
-
06推理与应用
模型 → 在线系统
- 量化、KV Cache 与批处理
- RAG、工具调用与 Agent
- API、监控与回滚
评估闭环:数据质量、模型行为与线上指标会持续反馈到数据、后训练和服务配置。
1.2 常见模型类型
| 类型 | 典型目标 | 代表性用途 |
|---|---|---|
| Encoder-only | 理解全部输入,常用双向注意力 | 分类、检索、表示学习 |
| Encoder-Decoder | 编码输入,再生成输出 | 翻译、摘要、结构转换 |
| Decoder-only | 根据历史预测下一个 token | GPT 类生成式 LLM |
| Mixture-of-Experts | 每个 token 只激活部分专家 | 扩大参数容量而控制单 token 计算 |
| 多模态模型 | 联合处理文本、图像、音频或视频 | 看图问答、语音助手、视频理解 |
本手册重点研究 decoder-only,因为现代通用生成式 LLM 大多以它为核心。
1.3 预训练模型、聊天模型与推理模型
- Base Model:主要接受 next-token prediction 训练。它擅长续写,但不一定服从对话指令。
- Instruction/Chat Model:在 Base Model 上经过 SFT 和对齐,学习 system/user/assistant 等角色与回答行为。
- Reasoning Model:在数据、训练目标或推理策略上强化多步问题求解。不要把“输出很长”自动等同于“推理更强”。
1.4 参数不是模型能力的唯一变量
能力受到多方面共同影响:
模型质量
≈ 架构
+ 参数规模
+ 训练 token 数
+ 数据质量与配比
+ 优化过程
+ 后训练数据
+ 推理策略
+ 评估与选择偏差同样参数量的两个模型可能表现差别很大;更大的模型也可能因为数据或训练问题而更差。
1.5 课堂活动:为一个模型建立生命周期档案
任选一个公开模型,只使用模型卡、技术报告和官方仓库,填写:
| 阶段 | 要寻找的证据 | 找不到时怎样写 |
|---|---|---|
| 数据 | 来源类型、语言、许可与过滤 | 明确“未公开”,不自行推测 |
| Tokenizer | 类型、词表、特殊 token、chat template | 记录具体 tokenizer revision |
| 预训练 | 架构、参数、上下文、训练 token | 区分报告值和二手估算 |
| 后训练 | SFT、偏好与安全方法 | 只写公开披露的流程 |
| 评估 | 任务、baseline、设置和限制 | 不把榜单均值等同产品质量 |
| 推理 | dtype、量化、服务后端和上下文 | 在自己的硬件重新测量 |
活动的重点是发现信息边界。技术专家应能准确写出“不知道”,而不是用相邻模型或行业惯例填补空白。
1.6 全景图验收
- Base Model、Chat Model 和 Reasoning Model 的训练目标或数据差别是什么?
- 为什么参数量相同仍可能表现差异很大?
- 哪些生命周期阶段可能引入 benchmark 泄漏?
- 线上延迟突然增加,应优先查看生命周期中的哪些环节?
- 把一个“模型回答过时事实”的问题分别映射到微调、RAG 和工具方案,说明取舍。
本章依据
原理性结论以原始论文、官方文档或公开教材为依据。论文中的实验结果只适用于其声明的模型、数据、硬件和评估设置。
Decoder-only 大语言模型、in-context learning 与规模化实验。
参数规模、训练 token 与计算预算之间的关系。
稀疏激活 Mixture-of-Experts 的代表性实现与约束。