15. 现代架构与高级主题
- 比较 MoE、长上下文、蒸馏和多模态的代价
- 区分架构机制与营销标签
- 为高级方案设计可证伪的评估
- Transformer、训练与推理章节
本章产物一个高级方案的架构决策记录,包含收益、约束、验证与退出条件。
15.1 Mixture-of-Experts(MoE)
Dense 模型每个 token 经过全部 MLP 参数。MoE 层包含多个专家和一个 router:
token hidden state
→ router 计算专家分数
→ 选择 top-k 专家
→ 专家分别计算
→ 加权合并MoE 可以让总参数量很大,而单 token 只激活少数专家。但它带来:
- Router 负载不均衡。
- Expert Parallel 通信。
- 某些专家过载或欠训练。
- 推理仍需存放或分布全部专家权重。
- batch 较小时专家利用率不足。
所以“总参数 100B、激活 10B”不等于在所有方面都和 dense 10B 一样便宜。
15.2 长上下文
把 context window 从 8K 扩到 128K,至少涉及:
- Attention 计算与内存。
- KV Cache。
- 位置编码外推。
- 训练时是否见过长样本。
- 长文档数据质量。
- 模型能否从中间准确找到信息。
“能接收 128K”不等于“能可靠使用每个位置”。评估要包含不同位置的 needle、跨段综合、多跳证据和干扰文档。
15.3 知识蒸馏
Teacher 给 Student 提供:
- 最终答案。
- soft logits。
- 中间表示。
- 推理轨迹或合成数据。
Student 学习 teacher 分布,目标可能结合真实标签和蒸馏 loss。风险是 teacher 的错误与偏见被复制;合成数据过多还可能降低多样性。
15.4 多模态模型
常见做法:
图像/音频 encoder
→ 产生连续特征
→ projector 映射到 LLM hidden space
→ 与文本 token 一起进入语言模型或把图像离散化为视觉 token。学习多模态时,需要额外掌握:
- 图像 patch/视觉 encoder。
- 音频频谱和声学 encoder。
- 跨模态对齐数据。
- 多模态位置和分辨率。
- 幻觉、OCR、时间一致性评估。
先完成文本 LLM 主线,再扩展多模态,避免同时引入过多变量。
15.5 Retrieval、Memory 与参数知识
三种“记住”:
- 参数记忆:训练进入权重,更新慢、难溯源。
- 上下文记忆:当前 prompt 中的信息,受窗口限制。
- 外部记忆:数据库、向量库、文件或结构化状态,可更新和审计。
设计系统时,最新事实、用户私有状态和精确记录通常更适合外部记忆,而不是反复微调进参数。
15.6 Interpretability
常见层次:
- 查看 attention pattern。
- Activation probing。
- Logit lens。
- Attribution。
- Mechanistic interpretability。
- Sparse autoencoder 等特征分析。
注意力权重不自动等于因果解释。模型“关注”某位置不证明该位置决定最终输出;需要干预、消融和对照实验。
15.7 高级架构不是功能清单
评估高级方案时,先把“机制—收益—代价—证据”写成一行:
| 方案 | 机制 | 预期收益 | 新增代价 | 最小验证 |
|---|---|---|---|---|
| MoE | 每个 token 路由到少数专家 | 增大总容量而控制激活计算 | 路由、通信、负载均衡 | 专家利用率、质量、吞吐 |
| 长上下文 | 扩大可处理序列并适配位置 | 单请求读取更多证据 | Attention、KV、训练长度分布 | 不同位置与干扰强度评估 |
| 蒸馏 | Student 拟合 Teacher 信号 | 更小模型接近部分能力 | Teacher 成本与错误继承 | 同题集质量—延迟前沿 |
| 多模态 | Encoder/Projector 接入非文本特征 | 处理图像、音频或视频 | 对齐数据与模态特有评估 | 单模态、跨模态、缺失模态对照 |
| 外部记忆 | 检索或状态存储 | 可更新、可审计的知识 | 索引、权限、一致性 | 检索与端到端分层评估 |
| 可解释性 | 探针、干预和特征分析 | 形成内部机制假设 | 工具误差和因果外推风险 | 干预能否预测行为变化 |
任何架构选择都必须回答:当前 baseline 的哪项指标不够?新机制如何针对该瓶颈?如果结果没有改善,如何退出而不让系统永久背负复杂度?
15.8 三个容量推演
MoE 激活量。 假设共有 64 个专家,每个 token 选择 top-2。不能因此说“只需要存 2 个专家”;单机或集群仍需让全部专家权重可访问。需要分别估算总权重存储、单 token 激活计算和 all-to-all 通信。
长上下文 KV。 若序列从 8K 扩到 32K,在层数、KV Head、Head Dimension、dtype 和 batch 不变时,KV Cache 约扩大 4 倍;标准 Attention 分数元素约扩大 16 倍。两者增长率不同,不能用一个“上下文成本”数字代替。
蒸馏前沿。 比较 Teacher 与 Student 时不要只看准确率。至少绘制:任务得分—P95 延迟、任务得分—内存、任务得分—每千 token 成本。若 Student 只便宜 5% 却明显退化,蒸馏未必值得维护。
15.9 设计实验:提交一份架构决策记录
从 MoE、长上下文、蒸馏、多模态、外部记忆或可解释性中选一个,填写:
问题:现有 baseline 的具体失败是什么?
证据:哪些逐样本结果或性能指标证明存在瓶颈?
候选:至少两个方案,包括“不改变架构”。
机制:候选方案为什么可能解决问题?
代价:数据、训练、推理、服务和运维新增什么?
实验:唯一改变的变量、样本、指标和硬件是什么?
通过条件:达到什么结果才采纳?
退出条件:失败时删除哪些组件、保留哪些产物?章节验收:能对一个流行架构提出可证伪的实验,而不是复述“更快、更长、更智能”;能把论文实验设置与自己的硬件、数据和业务边界分开。
本章依据
原理性结论以原始论文、官方文档或公开教材为依据。论文中的实验结果只适用于其声明的模型、数据、硬件和评估设置。
稀疏 MoE 路由、容量和训练稳定性。
- 论文RoFormer
旋转位置编码和长序列位置表示。
教师—学生知识蒸馏。
文本—图像对比学习的代表性多模态方法。