Skip to content
Closed
Show file tree
Hide file tree
Changes from all commits
Commits
File filter

Filter by extension

Filter by extension

Conversations
Failed to load comments.
Loading
Jump to
Jump to file
Failed to load files.
Loading
Diff view
Diff view
232 changes: 105 additions & 127 deletions docs/zh/part1/ch01_data_change.md

Large diffs are not rendered by default.

111 changes: 67 additions & 44 deletions docs/zh/part1/ch02_quality_framework.md

Large diffs are not rendered by default.

80 changes: 49 additions & 31 deletions docs/zh/part1/ch03_data_stack.md

Large diffs are not rendered by default.

17 changes: 16 additions & 1 deletion docs/zh/part1/index.md
Original file line number Diff line number Diff line change
Expand Up @@ -2,7 +2,22 @@

## 本篇定位

第一篇建立全书的共同认知框架,重点说明大模型数据工程的对象、边界、核心成本项与基础设施分层,为后续各篇的预训练、多模态、RAG、DataOps 和隐私治理内容提供统一坐标系。
第一篇建立全书的共同认知框架,重点说明大模型数据工程的对象、边界、质量目标、核心成本项与基础设施分层。它不以单一工具或单一模型为中心,而是从数据生命周期出发,解释为什么数据已经成为大模型能力、成本和风险控制的共同约束。

从出版稿结构看,本篇承担三项功能。第一,第1章给出问题背景和范式迁移,说明大模型研发为何必须从“模型中心”转向“数据与系统共同治理”。第二,第2章建立贯穿全书的数据质量语言,将噪声、重复、污染、偏差、缺失和时效等问题转化为可测量、可复盘、可阻断的工程指标。第三,第3章把质量框架落到基础设施层,讨论采集接入、处理编排、存储索引、评测运营和治理安全如何共同支撑训练与应用。

## 本篇学习目标

读完本篇后,读者应能够:

- 解释大模型数据工程与传统数据仓库、传统机器学习数据处理之间的关键差异。
- 识别预训练、指令微调、偏好对齐和 RAG 应用阶段的不同质量目标。
- 将常见数据问题映射为可检测的质量指标、治理动作和回滚策略。
- 依据团队规模和训练目标,初步设计 AI 原生数据栈与成本治理方案。

## 章节关系

第1章提出全书的基本命题:数据质量、数据规模和数据多样性共同决定模型能力边界。第2章回答“如何判断数据是否可用”,并给出质量评分卡和治理闸门。第3章回答“用什么基础设施承载这些治理动作”,并将后续各篇的清洗、对齐、RAG、DataOps 与合规内容放入统一架构中。

## 全书总目录

Expand Down
67 changes: 47 additions & 20 deletions docs/zh/part2/ch04_data_sources.md

Large diffs are not rendered by default.

81 changes: 63 additions & 18 deletions docs/zh/part2/ch05_cleaning_dedup.md

Large diffs are not rendered by default.

78 changes: 61 additions & 17 deletions docs/zh/part2/ch06_tokenization_loading.md

Large diffs are not rendered by default.

124 changes: 74 additions & 50 deletions docs/zh/part2/ch07_data_operations.md

Large diffs are not rendered by default.

28 changes: 22 additions & 6 deletions docs/zh/part2/index.md
Original file line number Diff line number Diff line change
Expand Up @@ -2,7 +2,27 @@

## 本篇定位

第二篇聚焦文本预训练语料,从数据源获取、版权边界、清洗去重、分词序列化到质量闭环,完整展开大规模文本数据流水线的构建方法。
第二篇聚焦文本预训练语料的生产、治理与持续迭代,讨论从数据源获取、版权边界、清洗去重、分词序列化,到质量评估与运营闭环的完整工程链路。本篇承接第一篇关于数据基础设施和质量框架的讨论,将抽象的数据生命周期落到可执行的文本预训练流水线;同时也为第三篇的多模态数据工程提供对照基线:只有先理解文本数据如何被采集、过滤、打包和评估,才能准确判断图像、文档、视频和音频数据为何会引入更复杂的表示、对齐和成本问题。

从 Springer 技术书章节结构看,本篇的目标不是罗列工具,而是建立可复用的工程判断框架。读者应能够回答三个问题:第一,哪些数据源适合进入预训练语料库,哪些来源需要隔离或剔除;第二,清洗、去重、去污染和脱敏如何共同定义训练数据质量;第三,分词、序列化、加载和评估运营如何把“可用数据”稳定转化为“可训练数据”。

## 本篇学习目标

- 建立文本预训练数据从来源、采集、解析到存证的完整治理视角。
- 掌握清洗、去重、PII 脱敏和基准去污染的关键工程方法。
- 理解分词、序列化、Packing、Mixing 与高效 DataLoader 对训练吞吐的影响。
- 能够设计离线代理指标、数据版本管理和质量闭环,支持持续迭代的数据运营。
- 能够区分公开网页、代码、学术论文、书籍、企业内部数据和用户反馈数据的不同风险边界。

## 读者前置知识

阅读本篇前,建议读者已理解第一篇中的数据生命周期、质量维度、成本治理和数据栈分层。若读者已有传统 ETL、数据湖或机器学习数据处理经验,可重点关注本篇与传统文本处理不同的部分:训练语料的版权与许可边界、基准污染、离线分词、序列 Packing、跨节点 DataLoader 和数据版本回滚。

## 章节逻辑

第4章回答“数据从哪里来以及是否能用”的问题,重点是来源画像、采集管线、版权许可和元数据存证。第5章回答“原始语料如何变成高质量语料”的问题,重点是规则过滤、模型评分、去重、PII 脱敏和基准去污染。第6章回答“高质量语料如何高效进入训练系统”的问题,重点是分词、序列化、Shard、Packing、Mixing 和 DataLoader 吞吐。第7章回答“如何判断数据版本是否真的改善模型”的问题,重点是离线代理指标、数据版本化、问题样本库、根因复盘和运营节奏。

本篇与前后篇的关系也很明确:它把第一篇提出的数据质量框架落到文本预训练语料的生产流程;同时,它为第三篇多模态数据工程提供对照基线。读者会看到,许多看似属于“文本清洗”的问题,例如来源许可、去重、污染、打包和评估,在图像、视频和音频场景中会变得更复杂。

## 本篇目录

Expand All @@ -11,8 +31,4 @@
- [第6章:分词、序列化与高效加载](ch06_tokenization_loading.md)
- [第7章:数据评估、质量闭环与运营迭代](ch07_data_operations.md)

## 建议阅读顺序

- 先读第4章,明确数据来源、授权条件与采集合规。
- 再读第5章和第6章,理解清洗、去重、分词与训练输入组织。
- 最后读第7章,把离线评测、线上反馈与运营闭环串起来。
建议按第4章至第7章顺序阅读。已有预训练经验的读者可以先读第7章建立质量闭环视角,再回到第4至第6章检查自己的数据管线是否具备可追溯、可诊断和可复现能力。
Loading
Loading