GOCLAWLLM ENGINEERING
GoClaw 首页

1. LLM 领域全景图

入门45~60 分钟
学习目标
  1. 画出 LLM 从数据到服务的生命周期
  2. 区分 Base、Chat 与 Reasoning Model
  3. 理解模型能力不由参数量单独决定
前置知识
  • 完成导学章节

本章产物用自己的话讲解六阶段生命周期,并为每阶段列出一个可观测指标。

1.1 一个 LLM 从出生到服务

1.2 常见模型类型

类型典型目标代表性用途
Encoder-only理解全部输入,常用双向注意力分类、检索、表示学习
Encoder-Decoder编码输入,再生成输出翻译、摘要、结构转换
Decoder-only根据历史预测下一个 tokenGPT 类生成式 LLM
Mixture-of-Experts每个 token 只激活部分专家扩大参数容量而控制单 token 计算
多模态模型联合处理文本、图像、音频或视频看图问答、语音助手、视频理解

本手册重点研究 decoder-only,因为现代通用生成式 LLM 大多以它为核心。

1.3 预训练模型、聊天模型与推理模型

1.4 参数不是模型能力的唯一变量

能力受到多方面共同影响:

模型质量
≈ 架构
  + 参数规模
  + 训练 token 数
  + 数据质量与配比
  + 优化过程
  + 后训练数据
  + 推理策略
  + 评估与选择偏差

同样参数量的两个模型可能表现差别很大;更大的模型也可能因为数据或训练问题而更差。

1.5 课堂活动:为一个模型建立生命周期档案

任选一个公开模型,只使用模型卡、技术报告和官方仓库,填写:

阶段要寻找的证据找不到时怎样写
数据来源类型、语言、许可与过滤明确“未公开”,不自行推测
Tokenizer类型、词表、特殊 token、chat template记录具体 tokenizer revision
预训练架构、参数、上下文、训练 token区分报告值和二手估算
后训练SFT、偏好与安全方法只写公开披露的流程
评估任务、baseline、设置和限制不把榜单均值等同产品质量
推理dtype、量化、服务后端和上下文在自己的硬件重新测量

活动的重点是发现信息边界。技术专家应能准确写出“不知道”,而不是用相邻模型或行业惯例填补空白。

1.6 全景图验收

  1. Base Model、Chat Model 和 Reasoning Model 的训练目标或数据差别是什么?
  2. 为什么参数量相同仍可能表现差异很大?
  3. 哪些生命周期阶段可能引入 benchmark 泄漏?
  4. 线上延迟突然增加,应优先查看生命周期中的哪些环节?
  5. 把一个“模型回答过时事实”的问题分别映射到微调、RAG 和工具方案,说明取舍。

本章依据

原理性结论以原始论文、官方文档或公开教材为依据。论文中的实验结果只适用于其声明的模型、数据、硬件和评估设置。

  1. Decoder-only 大语言模型、in-context learning 与规模化实验。

  2. 参数规模、训练 token 与计算预算之间的关系。

  3. 稀疏激活 Mixture-of-Experts 的代表性实现与约束。