开源大模型全链路训练实践:预训练、后训练与数据工程
国产开源模型的一手经验:首次系统总结DeepSeek、Qwen、ChatGLM等主流模型的训练方法,提供经过验证的工程**实践。

作者:周佺喜

定价:69.8元

印次:1-1

ISBN:9787302726258

出版日期:2026.10.01

印刷日期:2026.08.26

图书责编:袁金敏

图书分类:零售

电子书
在线购买
分享
内容简介
作者简介
前言序言
资源下载
查看详情 查看详情 查看详情

本书是一部系统阐述大模型训练技术的专业书,聚焦DeepSeek、Qwen、GLM、Kimi K2等国产主流开源模型,深入剖析架构创新与工程实践。全书共12章。第1章解析国内开源模型架构,涵盖MoE稀疏激活、多头潜在注意力等前沿设计;第2章介绍训练理论的数学基础;第3、4 章聚焦数据工程,包括数据采集、清洗、去重、过滤、质量评估、合成数据生成及课程学习策略;第5、6章详述预训练工程,涉及分布式架构设计、内存优化、训练监控与稳定性保障;第7~9章全面覆盖后训练技术,从监督微调、强化学习优化到对齐训练与安全机制;第10~12章探讨工程化实践,包括基础设施建设、模型压缩部署及持续学习迭代。 本书采用算法伪代码、数学公式、插图与表格等形式呈现技术要点,适合从事大模型研发的算法工程师、研究人员、技术架构师使用。

周佺喜,美国约翰霍普金斯大学人工智能硕士、英国华威大学工程硕士,拥有深厚的技术理论基础和工程实践能力。现任国家能源集团大模型智能平台首席架构师,阿里云人工智能高级认证工程师、IBM量子计算认证工程师。

大模型正在深刻重塑人工智能的技术格局与产业生态。从GPT系列的突破性进展到国产开源模型的快速崛起,从单纯追求参数规模到精细化的推理能力优化,每一次技术迭代都推动着产业边界的持续扩展。在这场全球性的技术革命中,DeepSeek、Qwen、GLM、KimiK2等国产开源大模型以创新的架构设计和卓越的工程实践,展现出强劲的技术实力,在多个关键维度上达到甚至超越国际领先水平。这一历史性跨越不仅彰显了技术自主创新的巨大价值,更为构建具有自主知识产权的人工智能技术体系奠定了坚实基础。 然而,技术的快速发展也带来了新的挑战。尽管开源模型的权重和代码日益丰富,但如何系统地掌握大模型训练的完整技术链路? 如何在有限资源下高效地完成从数据准备到模型部署的全流程? 如何将前沿的训练方法论转化为可复用的工程实践? 这些问题始终困扰着众多研究者和工程师。现有文献或偏重算法原理而缺乏工程深度,或聚焦应用部署而回避训练核心,难以为实际构建大模型的技术团队提供系统而全面的指导。 本书正是在这一背景下应运而生。全书聚焦国产主流开源模型的训练实践,系统梳理了从理论基础到工程落地的完整技术链路,致力于为读者构建一套可迁移、可复用的知识体系。 本书在内容组织上遵循“方法论优先”的原则。技术发展日新月异,特定模型的实现细节可能很快过时,但训练方法论的核心思想具有持久的价值。因此,本书着重提炼具有普适性的设计原则和优化策略,使读者能够将所学知识迁移到不同的模型架构和技术框架中。 通过对比分析DeepSeek的 MoE架构与 MLA机制、Qwen的混合思考模式与多模态融合、GLM的智能体原子能力、KimiK2的万亿参数训练...

目录
荐语
查看详情 查看详情
第1章 国内开源大模型技术体系概论 1 1.1 国内大模型发展格局与技术路线 1 1.1.1 主流开源模型架构对比分析 1 1.1.2 技术创新点与差异化策略 3 1.1.3 开源生态与社区建设现状 4 1.2 DeepSeek系列模型技术解析 5 1.2.1 MoE架构设计与稀疏激活机制 6 1.2.2 多头潜在注意力(MLA)创新 7 1.2.3 DeepSeek-R1推理模型与强化学习训练 9 1.3 Qwen系列模型技术解析 11 1.3.1 模型规模谱系与 MoE架构演进 11 1.3.2 多模态统一与多模态融合 13 1.3.3 混合思考模式与Agent能力 14 1.4 GLM系列模型技术解析 15 1.4.1 GLM架构特点与 MoE设计 15 1.4.2 智能体原子能力与推理模型 16 1.4.3 开源策略与生态布局 17 1.5 KimiK2模型技术解析 19 1.5.1 万亿参数 MoE架构设计 20 1.5.2 MuonClip优化器与训练稳定性 21 1.5.3 技术路线对比与选型建议 22 1.6 本章小结 24 第2章 训练理论的数学基础 25 2.1 优化理论与损失函数设计 25 2.1.1 梯度下降算法族的数学原理 25 2.1.2 自适应优化器的收敛性分析 27 2.1.3 损失函数的设计原则与权衡 28 2.2 分布式训练的理论基础 29 2.2.1 数据并行与模型并行的数学模型 29 Ⅳ 2.2.2 梯度同步与通信优化理论 31 2.2.3 流水线并行的效率分析 32 2.3 缩放定律与计算效率 34 2.3.1 ScalingLaw的数... 查看详情

聚焦DeepSeek、Qwen、GLM、Kimi等国产主流开源模型,案例丰富,讲解细致。

查看详情