大模型正在深刻重塑人工智能的技术格局与产业生态。从GPT系列的突破性进展到国产开源模型的快速崛起,从单纯追求参数规模到精细化的推理能力优化,每一次技术迭代都推动着产业边界的持续扩展。在这场全球性的技术革命中,DeepSeek、Qwen、GLM、KimiK2等国产开源大模型以创新的架构设计和卓越的工程实践,展现出强劲的技术实力,在多个关键维度上达到甚至超越国际领先水平。这一历史性跨越不仅彰显了技术自主创新的巨大价值,更为构建具有自主知识产权的人工智能技术体系奠定了坚实基础。 然而,技术的快速发展也带来了新的挑战。尽管开源模型的权重和代码日益丰富,但如何系统地掌握大模型训练的完整技术链路? 如何在有限资源下高效地完成从数据准备到模型部署的全流程? 如何将前沿的训练方法论转化为可复用的工程实践? 这些问题始终困扰着众多研究者和工程师。现有文献或偏重算法原理而缺乏工程深度,或聚焦应用部署而回避训练核心,难以为实际构建大模型的技术团队提供系统而全面的指导。 本书正是在这一背景下应运而生。全书聚焦国产主流开源模型的训练实践,系统梳理了从理论基础到工程落地的完整技术链路,致力于为读者构建一套可迁移、可复用的知识体系。 本书在内容组织上遵循“方法论优先”的原则。技术发展日新月异,特定模型的实现细节可能很快过时,但训练方法论的核心思想具有持久的价值。因此,本书着重提炼具有普适性的设计原则和优化策略,使读者能够将所学知识迁移到不同的模型架构和技术框架中。 通过对比分析DeepSeek的 MoE架构与 MLA机制、Qwen的混合思考模式与多模态融合、GLM的智能体原子能力、KimiK2的万亿参数训练稳定性等技术路线,本书总结出一套结构化的技术选择决策框架,帮助读者在实际项目中做出理性判断。 在表达形式上,本书采用“去代码化”的写作方式。考虑到完整代码实现往往冗长且与特定框架绑定,本书选择通过算法伪代码呈现核心逻辑,通过数学公式揭示理论根基,通过插图展示系统架构,通过配置文件片段展示关键参数设置。这种抽象化的表达方式既保证了内容的准确性,又提高了知识的可迁移性,使读者能够专注于理解原理而非纠缠于实现细节。 数据工程是本书特别强调的核心内容。大模型训练的成功与否,在很大程度上取决于训练数据的质量与多样性。本书系统介绍了数据采集、清洗、去重、质量评估、合成数据生成、数据配比与课程学习等关键技术,将数据工程提升到与模型训练同等重要的地位。这一Ⅱ编排反映了当前业界对大模型技术本质的共识,也是本书内容组织的重要特点。 期望通过系统学习本书内容,读者能够建立完整的大模型训练技术认知,具备独立构建和优化大模型的综合能力,积极参与推动人工智能技术自主创新的进程。 编 者2026年5月
