本仓库是 O'Reilly 图书 《AI Systems Performance Engineering》(作者 Chris Fregly,2026 年出版)的中文翻译项目。内容涵盖从硬件架构、操作系统与容器编排,到分布式网络通信、GPU 存储 I/O、CUDA 核函数优化、分布式训练与大规模推理服务等 AI 系统全栈性能工程主题。
版权说明:本仓库仅为学习与交流用途的翻译稿。原书版权归 O'Reilly Media 及作者所有(Copyright © 2026 Flux Capacitor, LLC,ISBN 979-8-341-62778-9)。请勿用于任何商业用途。
全书(前言 + 第 1–20 章 + 附录)已全部完成翻译、审校与精编。✅
| 章节 | 标题 | 翻译版 | 双语版 |
|---|---|---|---|
| 前言 | 前言 | ✅ | — |
| 第 1 章 | 引言与 AI 系统概览 | ✅ | — |
| 第 2 章 | AI 系统硬件概览 | ✅ | ✅ |
| 第 3 章 | 面向 GPU 环境的操作系统、Docker 与 Kubernetes 调优 | ✅ | ✅ |
| 第 4 章 | 分布式网络通信调优 | ✅ | ✅ |
| 第 5 章 | 基于 GPU 的存储 I/O 优化 | ✅ | ✅ |
| 第 6 章 | GPU 架构、CUDA 编程与最大化占用率 | ✅ | ✅ |
| 第 7 章 | GPU 内存访问模式的剖析与调优 | ✅ | ✅ |
| 第 8 章 | 占用率调优、Warp 效率与指令级并行 | ✅ | ✅ |
| 第 9 章 | 提升 CUDA 核函数效率与算术强度 | ✅ | ✅ |
| 第 10 章 | 核内流水线化、warp 专门化与协作式线程块簇 | ✅ | ✅ |
| 第 11 章 | 核间流水线化、同步与 CUDA 流序内存分配 | ✅ | ✅ |
| 第 12 章 | 动态调度、CUDA Graphs 与设备端发起的核函数编排 | ✅ | ✅ |
| 第 13 章 | PyTorch 的性能剖析、调优与扩展 | ✅ | ✅ |
| 第 14 章 | PyTorch 编译器、OpenAI Triton 与 XLA 后端 | ✅ | ✅ |
| 第 15 章 | 多节点推理、并行、解码与路由优化 | ✅ | ✅ |
| 第 16 章 | 大规模推理的剖析、调试与调优 | ✅ | ✅ |
| 第 17 章 | 面向推理的分离式 Prefill 与 Decode 扩展 | ✅ | ✅ |
| 第 18 章 | 高级 Prefill-Decode 与 KV 缓存调优 | ✅ | ✅ |
| 第 19 章 | 动态与自适应推理引擎优化 | ✅ | ✅ |
| 第 20 章 | AI 辅助的性能优化与迈向千万级 GPU 集群的扩展 | ✅ | ✅ |
| 附录 | AI 系统性能检查清单(175+ 项) | ✅ | ✅ |
说明:前言与第 1 章仅提供中文翻译版;其余各章同时提供翻译版与中英对照的双语版。
RawBook/
├── translation/ # 各章中文译文(ch1.md … ch20.md、appendix.md、preface.md)
├── bilingual/ # 各章中英逐段对照(ch2.md … ch20.md、appendix.md)
├── images/ # 全书配图(figure-N-M.png,共 202 张)
└── AI Systems Performance Engineering.pdf # 原书 PDF
- translation/:按章节命名的完整中文译文,
ch<N>.md对应第 N 章,appendix.md为附录,preface.md为前言。 - bilingual/:中英文逐段对照,便于校对(前言与第 1 章无双语版)。
- images/:全书插图集中存放;各 md 中以相对路径
../images/figure-N-M.png引用,可正常显示。
- 代码块保持原文,不作翻译。
- 专有名词在首次出现时以“中文(English)”形式括注,后续仅用中文。
- 数字、单位、公式与图表编号严格与原文一致(图注格式为“图 N-M.”)。
- 中文与英文/数字之间加空格;两个中文字符之间不加空格。
- 术语全书统一,同一术语只在首次出现处括注原文。
- 直接阅读
translation/下对应章节的.md获取中文译文。 - 需要对照原文时,阅读
bilingual/下对应章节的.md。 - 使用支持 Markdown 预览的编辑器(如 VS Code)打开,插图会自动从
images/加载。