本书是一部系统阐述大模型训练技术的专业书,聚焦DeepSeek、Qwen、GLM、Kimi K2等国产主流开源模型,深入剖析架构创新与工程实践。全书共12章。第1章解析国内开源模型架构,涵盖MoE稀疏激活、多头潜在注意力等前沿设计;第2章介绍训练理论的数学基础;第3、4 章聚焦数据工程,包括数据采集、清洗、去重、过滤、质量评估、合成数据生成及课程学习策略;第5、6章详述预训练工程,涉及分布式架构设计、内存优化、训练监控与稳定性保障;第7~9章全面覆盖后训练技术,从监督微调、强化学习优化到对齐训练与安全机制;第10~12章探讨工程化实践,包括基础设施建设、模型压缩部署及持续学习迭代。
本书采用算法伪代码、数学公式、插图与表格等形式呈现技术要点,适合从事大模型研发的算法工程师、研究人员、技术架构师使用。
