LLM Internals 完全指南:从分词到注意力到推理优化,18个主题带你彻底拆解大模型内部
【免费下载链接】llm-internalsLearn LLM internals step by step - from tokenization to attention to inference optimization.项目地址https://gitcode.com/gh_mirrors/ll/llm-internals点击查看免费下载LLM Internals是一个手把手教你学习大模型内部原理的开源教程项目覆盖从Tokenization分词到Attention注意力机制再到LLM 推理优化的完整学习路径。它不堆砌代码而是用一步步的数值例子把大模型拆开给你看非常适合想搞懂大模型内部的新手和普通开发者。 这个项目是什么一句话概括LLM Internals 是一个大模型内部拆解系列教程由 Outcome School 创始人 Amit Shekhar 编写维护。它的核心特点是循序渐进从LLM 到底是什么讲起逐步深入到注意力数学、推理加速数值例子驱动每个主题都配 step-by-step 的数值演示不靠背公式面向理解而非调包目标是让你真正明白 Transformer 每个组件在做什么贴近生产KV Cache、Flash Attention、连续批处理都是线上推理服务的核心技术所有主题的总目录维护在 README.md 中项目采用 Apache 2.0 协议开源内容还在持续更新。 18 个主题学习路线总览整个项目可以把主题归纳为4 大阶段、18 个核心主题由浅入深阶段编号主题你会学到什么一、基础篇1LLM 全景概览LLM、RAG、MCP、Agent、微调、量化的整体地图2Tokenization 与 BPE大模型如何把文本切成 TokenBPE 算法逐步拆解3Transformer 架构编码器/解码器、数据流、三大架构变体二、注意力篇4注意力数学Q、K、VQ×Kᵀ、缩放、Softmax、加权和的完整数值推导5因果掩码 Causal Masking如何阻止模型偷看未来的 Token6RoPE 旋转位置编码用 2D 旋转数学注入相对位置信息的原理三、训练篇7反向传播 Backpropagation链式法则、前向/反向传播、梯度下降更新权重8交叉熵损失 Cross-Entropy语言模型训练最核心损失函数的数学与梯度9前馈网络 FFNTransformer 每层中膨胀-收缩结构学什么10归一化BatchNorm vs LayerNorm vs RMSNorm三种归一化的区别以及为什么现代 LLM 偏爱 RMSNorm四、推理优化篇11KV Cache为什么只缓存 K 和 V速度提升多少内存代价几何12Flash Attention分块 在线 Softmax吃透 GPU 显存的注意力加速13Paged Attention借鉴操作系统分页思想解决 KV Cache 内存碎片14Speculative Decoding 投机解码小模型打草稿 大模型验证2~3 倍加速且零质量损失15Continuous Batching 连续批处理拼车式调度让 GPU 全程满载16Prompt Caching 提示词缓存精确前缀规则、TTLAI 助手如何省成本17Prefill vs Decode推理两大阶段的差异TTFT/TPOT 等核心指标18Mixture of ExpertsMoE路由器 专家 稀疏激活大模型为何又强又省 一、基础篇先搭起大模型的地基1. LLM 全景概览入门第一课先回答LLM 到底是什么并顺带串起RAG检索增强生成、MCP、Agent、Fine-tuning微调、Quantization量化这几个高频概念帮你建立整体坐标系。2. Tokenization 与 BPE大模型不认识字符只认识 Token。这一主题回答三个问题为什么要分词、怎么切才合理、以及Byte Pair Encoding字节对编码如何一步步把词表训出来包括 BPE 遇到新文本时的处理逻辑。3. Transformer 架构把 Transformer 逐块解码Tokenization、Embedding、位置编码、Multi-Head Attention、FFN、残差连接、Layer Normalization 各自负责什么数据如何流经整个架构以及 Encoder-only / Decoder-only / Encoder-Decoder 三种变体的取舍。 二、注意力篇大模型真正的大脑4. 注意力数学Q、K、V这是全项目最硬核的数值推导之一从词 → 向量出发构造QQuery、KKey、VValue矩阵计算 Q×Kᵀ 得到注意力分数再经过√dₖ 缩放、Softmax 归一化最后与 V 加权求和。每个步骤都有具体数字看完注意力机制不再玄学。5. 因果掩码Causal Masking生成文本时当前词不能参考后面的词。这个主题用一个看到未来 Token的反例说明问题再给出下三角掩码矩阵的实现方式解释 GPT 这类自回归模型为何只能往前看。6. RoPE 旋转位置编码Transformer 本身不感知词序RoPE 通过2D 旋转矩阵把位置信息编码进 Q 和 K让点积天然携带相对位置信息。文章会讲清旧方案可学习位置编码的局限、RoPE 的核心思想和一个小数值例子。 三、训练篇模型是怎么学会说话的7. 反向传播Backpropagation神经网络学习的核心算法从链式法则讲起走一遍前向传播 → 计算损失 → 反向传播 → 梯度下降更新权重的完整流程并用 Python 风格的小例子把梯度算给你看。8. 交叉熵损失Cross-Entropy Loss我有 70% 把握这是猫——模型预测的概率和真实答案差多少交叉熵损失就是这个度量尺它驱动着包括 GPT、BERT 在内的几乎所有现代 AI 模型训练。主题覆盖公式推导、为什么取负对数、语言模型场景下的用法及其梯度。9. 前馈网络FFN注意力负责信息交互FFN 负责加工理解。这个主题拆解 Transformer 每层中的Expand-then-Contract先膨胀后收缩结构、ReLU 等激活函数的作用以及 FFN 到底占了模型多少参数——顺便引出 Mixture of Experts 的伏笔。10. 归一化三兄弟BatchNorm vs LayerNorm vs RMSNorm深度网络为什么需要归一化BatchNorm 和 LayerNorm 差在哪为什么 Llama、Mistral、Qwen、DeepSeek 等现代大模型几乎都选RMSNorm主题会用具体数值对比三者计算差异并给出何时用哪个的实用建议。 四、推理优化篇让大模型又快又省这一篇直接对接生产环境的 LLM 推理优化是普通用户感知最明显的部分响应速度、服务成本。11. KV Cache生成加速的第一把钥匙LLM 逐 Token 生成时历史 Token 的 K、V 会反复计算。KV Cache 把结果存下来复用只缓存 K 和 V 而不缓存 Q 的原因、能快多少、以及速度 vs 内存的权衡都会讲透。12. Flash Attention吃透 GPU 显存的注意力算法标准注意力为什么慢答案藏在 GPU 的 HBM 与 SRAM 层级里。Flash Attention 通过分块Tiling 在线 Softmax 反向重计算把注意力计算贴在高速显存里如今几乎每个现代 LLM 都在用。主题还会顺带介绍 Flash Attention 2 / 3 的演进。13. Paged Attention给 KV Cache 做分页KV Cache 会浪费显存Paged Attention 借鉴操作系统的虚拟内存分页思想把注意力 KV 存储切成小页动态分配并支持请求间共享让同一张 GPU 服务更多用户。14. Speculative Decoding 投机解码小模型快速打草稿大模型批量批改验证——拒绝采样保证输出质量零损失实测可带来2~3 倍生成加速。这是当下推理加速最热门的技巧之一。15. Continuous Batching 连续批处理静态批处理要等最短的请求跑完才放新请求GPU 大量空转。连续批处理像拼车一样每生成一步都可插入新请求、放走已完成请求显著提升服务吞吐。16. Prompt Caching 提示词缓存AI 助手的系统提示往往很长且固定。Prompt Caching 按精确前缀规则缓存前缀计算结果配合写缓存/读缓存与 TTL 机制直接降低时延和成本。主题还会给出什么内容值得放进缓存的实战建议。17. Prefill vs Decode推理优化的两阶段地图LLM 推理分Prefill预填充计算密集和Decode解码内存带宽密集两个阶段KV Cache 是连接二者的桥梁。理解这个划分才能对号入座地选优化手段也才能真正看懂TTFT、TPOT、吞吐、端到端时延这些核心指标。18. Mixture of ExpertsMoE混合专家为什么有的模型参数量巨大却推理便宜MoE 用路由器Router从众多专家中稀疏激活少数几个把大模型容量和小模型成本兼得支撑着今天许多最强 LLM。主题涵盖专家的本质、MoE 在 Transformer 中的位置、负载均衡与工程挑战。 加餐进阶主题持续更新中完成 18 个核心主题后项目里还有一批进阶内容等你探索Grouped Query AttentionGQAMHA / MQA / GQA 三者对比与上训练迁移方法LoRA 低秩适配不动主干、只训小矩阵的微调方案Large Reasoning ModelsLRM会先思考再回答的推理大模型RLHFSFT → 奖励模型 → PPO 三阶段把模型调得有用且安全Decoding DeepSeek-V4百万 Token 上下文、混合注意力、FP4 量化感知训练的前沿拆解Prompt Injection 提示词注入AI 应用安全必修课含攻击演练与防御清单Harness EngineeringAI Agent 与评测系统中的挽具工程️ 如何开始学习打开 README.md每个主题都有内容大纲摘要挑一个感兴趣的切入点建议按上面基础篇 → 注意力篇 → 训练篇 → 推理优化篇的顺序学前期打地基、后期看工程项目会持续新增博客和视频保持关注即可同步最新主题✅ 小结LLM Internals的价值在于把大模型拆成人话18 个核心主题覆盖分词 → 注意力 → 训练 → 推理优化全链路每个主题都带数值例子新手也能跟推推理优化篇KV Cache、Flash Attention、投机解码、连续批处理直接对齐工业界实践如果你一直想系统搞懂大模型内部这就是目前最友好的一条学习路径Keep learning赞分享【免费下载链接】llm-internalsLearn LLM internals step by step - from tokenization to attention to inference optimization.项目地址https://gitcode.com/gh_mirrors/ll/llm-internals点击查看免费下载相关推荐Pusher-js 高级功能实战在线状态、订阅计数和客户端事件的深度应用Pusher js 高级功能实战在线状态、订阅计数和客户端事件的深度应用 Pusher js 是一款功能强大的实时通信库为开发者提供了构建实时应用的核心能力深入解析Aceso核心原理从Instant Run Hot Swap到Android热修复的完整实现深入解析Aceso核心原理从Instant Run Hot Swap到Android热修复的完整实现 Aceso作为一款专注于Android平台的热修复库能攻克自底向上注意力模型十大技术难题从环境配置到性能优化全指南攻克自底向上注意力模型十大技术难题从环境配置到性能优化全指南 引言自底向上注意力模型的实践痛点与解决方案 你是否在配置自底向上注意力Bottom Up A计算机视觉深度学习人工智能创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考