课程
CUDA 编程入门
CUDA 核心概念与并行编程模型,适合作为 GPU 编程的第一站。
CMU 15-418 / 15-618 并行计算
并行体系结构与性能优化的经典课程,覆盖 GPU、多核与集群。
书籍
《AI Systems Performance Engineering》
从硬件、内核到分布式训练与推理的全栈性能工程,当前在读。
《Programming Massively Parallel Processors》
CUDA 与大规模并行处理的标准教材,配套 CUDA 最佳实践。
论文
博客与文档
- vLLM 官方文档 — 推理引擎的配置与架构说明
- NVIDIA CUDA C++ Programming Guide — CUDA 权威参考
- NVIDIA GPU 架构白皮书 — Hopper / Blackwell 等架构细节
- Lilian Weng 的技术博客 — 大模型与系统方向的综述型文章
- Hugging Face Blog — 模型与推理优化实践
开源项目
- vLLM — 高吞吐 LLM 推理与服务引擎
- LeetCUDA — CUDA 算子练习集
- nano-vLLM — 精简版 vLLM 实现,适合读源码
- KuiperLLama — 从零实现 LLM 推理框架