Skip to content

Latest commit

 

History

8 Commits

Folders and files

NameName
Last commit message
Last commit date
 
 
 
 
 
 

Repository files navigation

AI 系统性能工程(中文翻译)

本仓库是 O'Reilly 图书 《AI Systems Performance Engineering》(作者 Chris Fregly,2026 年出版)的中文翻译项目。内容涵盖从硬件架构、操作系统与容器编排,到分布式网络通信、GPU 存储 I/O、CUDA 核函数优化、分布式训练与大规模推理服务等 AI 系统全栈性能工程主题。

版权说明:本仓库仅为学习与交流用途的翻译稿。原书版权归 O'Reilly Media 及作者所有(Copyright © 2026 Flux Capacitor, LLC,ISBN 979-8-341-62778-9)。请勿用于任何商业用途。

翻译进度

全书(前言 + 第 1–20 章 + 附录)已全部完成翻译、审校与精编。✅

章节 标题 翻译版 双语版
前言 前言
第 1 章 引言与 AI 系统概览
第 2 章 AI 系统硬件概览
第 3 章 面向 GPU 环境的操作系统、Docker 与 Kubernetes 调优
第 4 章 分布式网络通信调优
第 5 章 基于 GPU 的存储 I/O 优化
第 6 章 GPU 架构、CUDA 编程与最大化占用率
第 7 章 GPU 内存访问模式的剖析与调优
第 8 章 占用率调优、Warp 效率与指令级并行
第 9 章 提升 CUDA 核函数效率与算术强度
第 10 章 核内流水线化、warp 专门化与协作式线程块簇
第 11 章 核间流水线化、同步与 CUDA 流序内存分配
第 12 章 动态调度、CUDA Graphs 与设备端发起的核函数编排
第 13 章 PyTorch 的性能剖析、调优与扩展
第 14 章 PyTorch 编译器、OpenAI Triton 与 XLA 后端
第 15 章 多节点推理、并行、解码与路由优化
第 16 章 大规模推理的剖析、调试与调优
第 17 章 面向推理的分离式 Prefill 与 Decode 扩展
第 18 章 高级 Prefill-Decode 与 KV 缓存调优
第 19 章 动态与自适应推理引擎优化
第 20 章 AI 辅助的性能优化与迈向千万级 GPU 集群的扩展
附录 AI 系统性能检查清单(175+ 项)

说明:前言与第 1 章仅提供中文翻译版;其余各章同时提供翻译版与中英对照的双语版。

目录结构

RawBook/
├── translation/    # 各章中文译文(ch1.md … ch20.md、appendix.md、preface.md)
├── bilingual/      # 各章中英逐段对照(ch2.md … ch20.md、appendix.md)
├── images/         # 全书配图(figure-N-M.png,共 202 张)
└── AI Systems Performance Engineering.pdf   # 原书 PDF
  • translation/:按章节命名的完整中文译文,ch<N>.md 对应第 N 章,appendix.md 为附录,preface.md 为前言。
  • bilingual/:中英文逐段对照,便于校对(前言与第 1 章无双语版)。
  • images/:全书插图集中存放;各 md 中以相对路径 ../images/figure-N-M.png 引用,可正常显示。

翻译约定

  • 代码块保持原文,不作翻译。
  • 专有名词在首次出现时以“中文(English)”形式括注,后续仅用中文。
  • 数字、单位、公式与图表编号严格与原文一致(图注格式为“图 N-M.”)。
  • 中文与英文/数字之间加空格;两个中文字符之间不加空格。
  • 术语全书统一,同一术语只在首次出现处括注原文。

阅读方式

  • 直接阅读 translation/ 下对应章节的 .md 获取中文译文。
  • 需要对照原文时,阅读 bilingual/ 下对应章节的 .md
  • 使用支持 Markdown 预览的编辑器(如 VS Code)打开,插图会自动从 images/ 加载。

About

AI Infra 的学习内容以及所有的知识

Resources

Stars

2 stars

Watchers

0 watching

Forks

Releases

Packages

Contributors