AI 学习目录:基础、AI Infra 与项目实战
2026/10/5大约 4 分钟人工智能AIAI学习目录阅读导航
AI 学习目录:基础、AI Infra 与项目实战
建议先阅读 AI 基础,再按需要进入 AI Infra 和项目实战。AI Infra 内的条目按专题归类;同一专题中的独立文章可以结合当前问题选择阅读,不把列表顺序当成严格的前置依赖。
AI基础 / 深度学习
- 深度学习模型入门:参数权重、网络结构与计算图
- Tensor 与 Shape 图解:维度、Stride 与广播
- 深度学习常见层与算子:Linear、Norm 与 Softmax
- 训练与推理的区别:前向、反向与显存账本
- 数值精度与显存:FP32、BF16、量化及混合精度
- 模型如何运行在 GPU:Kernel、存储层次与性能瓶颈
AI基础 / Transformer
- Transformer 入门图解:Token、Embedding 与信息流
- Self-Attention 图解:QKV、缩放、Mask 与加权读取
- Transformer Block 图解:多头注意力、FFN 与残差
- LLM 生成图解:Decoder-only、Logits 与逐 Token 输出
- LLM 推理工程图解:Prefill、Decode 与 KV Cache
- LLM 推理服务图解:队列、批处理与资源调度
- 图解 Transformer:自注意力、位置编码与编码器解码器
- Transformer 注意力机制:从点积到多头计算
AI-Infra / 学习导览与面试
AI-Infra / 模型结构与编码
- GQA 与 MQA 原理:注意力结构如何影响 KV Cache
- 大模型结构与推理工程:从配置到 SGLang 热路径
- BPE 与 WordPiece:大模型 Tokenizer 编码原理
- 模型 config.json 解析:MLA、MoE、MTP 与量化
- 滑动窗口注意力 SWA:KV Cache 与长上下文推理
AI-Infra / KV-Cache与显存
AI-Infra / 算子与Attention优化
- AI Infra 常用算子:GEMM、Softmax 与 Attention 入门
- FlashAttention V1 到 V4:分块、在线 Softmax 与演进
- 投机解码端到端解析:EAGLE、接受判定与调优
AI-Infra / CUDA与Triton
- CUDA 与 Triton 学习导览:硬件、编程与分析工具
- CUDA 硬件基础:GPU 存储层次与 Hopper 架构
- CUDA 编程优化:合并访存、Bank Conflict 与 Tiling
- CUDA 性能分析:Nsight、Graph、Stream 与 CUTLASS
- Triton 入门教程:Block 编程模型与算子实现
AI-Infra / 并行通信与PD分离
- DP 与 DPA 的区别:SGLang 并行部署与路由
- PD 分离中的 KV Cache:利用率与 Router 负载均衡
- PD 分离数据流:KV 生成、传输与 Decode 交接
- 图解模型推理的八种集合通信原语
- 图解推理并行策略:DP、TP、SP、CP、EP 与 CPP
AI-Infra / 推理调度与性能分析
- Chunked Prefill 原理:LLM 调度、延迟与吞吐权衡
- Decode 显存带宽估算:权重、KV Cache 与 Batch
- Prefill FLOPs 估算:模型线性计算与 Attention 成本
- TTFT 排查手册:首字延迟拆解、观测与优化
- 大模型推理性能估算:显存、吞吐与容量规划




