图书目录

第1章 国内开源大模型技术体系概论 1 1.1 国内大模型发展格局与技术路线 1 1.1.1 主流开源模型架构对比分析 1 1.1.2 技术创新点与差异化策略 3 1.1.3 开源生态与社区建设现状 4 1.2 DeepSeek系列模型技术解析 5 1.2.1 MoE架构设计与稀疏激活机制 6 1.2.2 多头潜在注意力(MLA)创新 7 1.2.3 DeepSeek-R1推理模型与强化学习训练 9 1.3 Qwen系列模型技术解析 11 1.3.1 模型规模谱系与 MoE架构演进 11 1.3.2 多模态统一与多模态融合 13 1.3.3 混合思考模式与Agent能力 14 1.4 GLM系列模型技术解析 15 1.4.1 GLM架构特点与 MoE设计 15 1.4.2 智能体原子能力与推理模型 16 1.4.3 开源策略与生态布局 17 1.5 KimiK2模型技术解析 19 1.5.1 万亿参数 MoE架构设计 20 1.5.2 MuonClip优化器与训练稳定性 21 1.5.3 技术路线对比与选型建议 22 1.6 本章小结 24 第2章 训练理论的数学基础 25 2.1 优化理论与损失函数设计 25 2.1.1 梯度下降算法族的数学原理 25 2.1.2 自适应优化器的收敛性分析 27 2.1.3 损失函数的设计原则与权衡 28 2.2 分布式训练的理论基础 29 2.2.1 数据并行与模型并行的数学模型 29 Ⅳ 2.2.2 梯度同步与通信优化理论 31 2.2.3 流水线并行的效率分析 32 2.3 缩放定律与计算效率 34 2.3.1 ScalingLaw的数学推导 34 2.3.2 计算最优与数据最优的平衡点 36 2.3.3 模型规模与性能的幂律关系 37 2.4 注意力机制的数学本质 39 2.4.1 自注意力的信息论解释 39 2.4.2 位置编码的频域分析 40 2.4.3 注意力优化的复杂度分析 41 2.5 本章小结 43 第3章 训练数据的采集与清洗 44 3.1 数据源评估与采集策略 44 3.1.1 开源数据集的质量评估框架 44 3.1.2 网络爬取的法律边界与技术实现 46 3.1.3 专有数据的获取与处理流程 47 3.2 数据清洗Pipeline设计 48 3.2.1 文本规范化与编码统一 48 3.2.2 噪声识别与过滤算法 49 3.2.3 敏感信息检测与脱敏处理 50 3.3 去重技术与实现策略 51 3.3.1 MinHash算法原理与优化 51 3.3.2 语义去重的向量化方法 53 3.3.3 大规模去重的分布式实现 54 3.4 数据质量评估体系 55 3.4.1 语言质量的自动化评分 56 3.4.2 知识覆盖度的量化指标 57 3.4.3 毒性与偏见的检测方法 58 3.5 本章小结 59 第4章 数据增强与合成技术 61 4.1 基于规则的数据增强 61 4.1.1 回译与paraphrase生成 61 4.1.2 模板化数据的批量生成 63 4.1.3 知识图谱驱动的数据扩充 64 4.2 基于模型的数据合成 65 4.2.1 Self-Instruct方法与实践 66 4.2.2 ConstitutionalAI数据生成 68 Ⅴ 4.2.3 迭代优化的数据质量提升 69 4.3 合成数据的质量控制 71 4.3.1 多样性与覆盖度评估 71 4.3.2 合成数据的验证策略 72 4.3.3 人工与自动评估的结合 74 4.4 数据配比与课程学习 75 4.4.1 领域数据的最优混合比例 75 4.4.2 课程学习的排序策略 77 4.4.3 动态数据选择算法 78 4.5 本章小结 79 第5章 预训练架构设计与实现 80 5.1 训练框架选型与适配 80 5.1.1 主流训练框架对比分析 80 5.1.2 国产模型的框架适配要点 82 5.1.3 自定义算子的开发指南 83 5.2 分布式训练架构设计 85 5.2.1 3D/4D并行策略的选择与组合 85 5.2.2 通信拓扑的优化设计 87 5.2.3 容错机制与检查点管理 88 5.3 内存优化与计算加速 90 5.3.1 激活重计算的策略选择 90 5.3.2 混合精度训练的稳定性保障 91 5.3.3 FlashAttention与 MLA的工程实现 92 5.4 超参数调优策略 95 5.4.1 学习率调度的设计原则 95 5.4.2 批次大小与梯度累积策略 96 5.4.3 正则化参数的经验设置 97 5.5 本章小结 98 第6章 预训练过程监控与调试 100 6.1 训练指标体系设计 100 6.1.1 损失曲线的异常模式识别 100 6.1.2 梯度统计与权重分布监控 102 6.1.3 验证集性能的在线评估 104 6.2 训练稳定性保障 106 6.2.1 梯度爆炸与消失的诊断 106 6.2.2 数值稳定性的保障措施 108 6.2.3 MoE负载均衡与稳定性 110 Ⅵ 6.2.4 训练发散的恢复策略 111 6.3 性能瓶颈分析与优化 113 6.3.1 计算与通信的性能剖析 113 6.3.2 数据加载的Pipeline优化 115 6.3.3 GPU利用率的提升方法 117 6.4 实验管理与版本控制 118 6.4.1 实验配置的标准化管理 118 6.4.2 模型版本与数据版本追踪 120 6.4.3 实验结果的自动化分析 122 6.5 本章小结 123 第7章 监督微调与指令调优 125 7.1 指令数据的构建方法 125 7.1.1 任务分类与指令模板设计 125 7.1.2 多轮对话数据的组织形式 126 7.1.3 Chain-of-Thought数据构造 128 7.2 SFT训练策略优化 130 7.2.1 数据采样与重要性加权 130 7.2.2 多任务学习的平衡策略 131 7.2.3 灾难性遗忘的缓解方法 132 7.3 参数高效微调技术 134 7.3.1 LoRA及其变体的原理分析 134 7.3.2 MoE模型的参数高效微调 135 7.3.3 混合微调策略的设计 137 7.4 微调效果评估方法 139 7.4.1 任务特定指标的设计 139 7.4.2 泛化能力的测试策略 140 7.4.3 人工评估的组织实施 141 7.5 本章小结 143 第8章 强化学习与偏好优化 144 8.1 RLHF技术体系详解 144 8.1.1 奖励模型的训练策略 144 8.1.2 PPO算法的实现要点 145 8.1.3 KL散度约束的作用机制 147 8.2 直接偏好优化方法 148 8.2.1 DPO算法原理与推导 148 8.2.2 IPO、CPO与GRPO的改进思路 149 8.2.3 在线与离线方法的对比 151 Ⅶ 8.3 RLAIF与自动化反馈 152 8.3.1 AI反馈的可靠性分析 152 8.3.2 ConstitutionalAI训练流程 153 8.3.3 迭代改进的反馈机制 155 8.4 推理模型与过程奖励 156 8.4.1 过程奖励模型(PRM)的设计 156 8.4.2 步骤级监督的实现方法 158 8.4.3 推理路径的质量评估 160 8.5 本章小结 161 第9章 对齐技术与安全训练 163 9.1 价值对齐的技术框架 163 9.1.1 有用性、诚实性、无害性平衡 163 9.1.2 红队测试与对抗训练 164 9.1.3 Constitutional方法与自我改进 166 9.1.4 安全边界的定义与实施 167 9.2 偏见缓解与公平性 168 9.2.1 偏见的检测与量化方法 168 9.2.2 去偏技术的算法实现 170 9.2.3 公平性指标的设计原则 171 9.3 鲁棒性与对抗防御 173 9.3.1 对抗样本的生成与检测 173 9.3.2 鲁棒训练的策略选择 174 9.3.3 防御机制的有效性评估 175 9.4 可解释性与透明度 177 9.4.1 注意力可视化技术 177 9.4.2 特征归因方法的应用 179 9.4.3 决策过程的追踪机制 180 9.5 本章小结 181 第10章 训练基础设施建设 183 10.1 计算集群架构设计 183 10.1.1 网络拓扑与带宽规划 183 10.1.2 存储系统的性能优化 185 10.1.3 调度系统的选型配置 187 10.2 训练平台工程化 188 10.2.1 容器化与环境管理 189 10.2.2 自动化训练Pipeline 190 10.2.3 监控告警体系建设 192 Ⅷ 10.3 成本优化策略 193 10.3.1 算力资源的动态分配 193 10.3.2 Spot实例的使用策略 195 10.3.3 训练效率的量化分析 196 10.4 团队协作与知识管理 198 10.4.1 实验协作流程设计 198 10.4.2 知识库的构建和维护 200 10.4.3 最佳实践的沉淀机制 201 10.5 本章小结 202 第11章 模型压缩与部署优化 204 11.1 量化技术实践 204 11.1.1 训练后量化的方法选择 204 11.1.2 量化感知训练的实施 206 11.1.3 混合精度量化策略 207 11.2 知识蒸馏技术 209 11.2.1 教师模型的选择策略 209 11.2.2 蒸馏损失的设计优化 210 11.2.3 多教师蒸馏的实现 211 11.3 模型剪枝与稀疏化 213 11.3.1 结构化剪枝的算法设计 213 11.3.2 非结构化剪枝的实现 215 11.3.3 动态稀疏训练方法 216 11.4 推理加速技术 217 11.4.1 KVCache优化策略 217 11.4.2 MoE模型的推理优化 219 11.4.3 批处理与并发优化 220 11.4.4 硬件加速的适配方法 221 11.5 本章小结 222 第12章 持续学习与模型迭代 223 12.1 增量学习策略 223 12.1.1 新数据的融合方法 223 12.1.2 知识保留机制设计 224 12.1.3 性能退化的检测预防 226 12.2 模型版本管理 227 12.2.1 版本发布流程规范 227 12.2.2 A/B测试的实施方案 229 12.2.3 回滚机制的设计实现 230 Ⅸ 12.3 在线学习与实时更新 232 12.3.1 流式数据的处理策略 232 12.3.2 在线RLHF的工程实现 234 12.3.3 实时性能监控体系 236 12.4 长期维护与演进规划 237 12.4.1 技术债务的管理策略 237 12.4.2 架构演进的规划方法 238 12.4.3 生态系统的持续建设 240 12.5 本章小结 241