


作者:周佺喜
定价:69.8元
印次:1-1
ISBN:9787302726258
出版日期:2026.10.01
印刷日期:2026.08.26
图书责编:袁金敏
图书分类:零售
本书是一部系统阐述大模型训练技术的专业书,聚焦DeepSeek、Qwen、GLM、Kimi K2等国产主流开源模型,深入剖析架构创新与工程实践。全书共12章。第1章解析国内开源模型架构,涵盖MoE稀疏激活、多头潜在注意力等前沿设计;第2章介绍训练理论的数学基础;第3、4 章聚焦数据工程,包括数据采集、清洗、去重、过滤、质量评估、合成数据生成及课程学习策略;第5、6章详述预训练工程,涉及分布式架构设计、内存优化、训练监控与稳定性保障;第7~9章全面覆盖后训练技术,从监督微调、强化学习优化到对齐训练与安全机制;第10~12章探讨工程化实践,包括基础设施建设、模型压缩部署及持续学习迭代。 本书采用算法伪代码、数学公式、插图与表格等形式呈现技术要点,适合从事大模型研发的算法工程师、研究人员、技术架构师使用。
周佺喜,美国约翰霍普金斯大学人工智能硕士、英国华威大学工程硕士,拥有深厚的技术理论基础和工程实践能力。现任国家能源集团大模型智能平台首席架构师,阿里云人工智能高级认证工程师、IBM量子计算认证工程师。
大模型正在深刻重塑人工智能的技术格局与产业生态。从GPT系列的突破性进展到国产开源模型的快速崛起,从单纯追求参数规模到精细化的推理能力优化,每一次技术迭代都推动着产业边界的持续扩展。在这场全球性的技术革命中,DeepSeek、Qwen、GLM、KimiK2等国产开源大模型以创新的架构设计和卓越的工程实践,展现出强劲的技术实力,在多个关键维度上达到甚至超越国际领先水平。这一历史性跨越不仅彰显了技术自主创新的巨大价值,更为构建具有自主知识产权的人工智能技术体系奠定了坚实基础。 然而,技术的快速发展也带来了新的挑战。尽管开源模型的权重和代码日益丰富,但如何系统地掌握大模型训练的完整技术链路? 如何在有限资源下高效地完成从数据准备到模型部署的全流程? 如何将前沿的训练方法论转化为可复用的工程实践? 这些问题始终困扰着众多研究者和工程师。现有文献或偏重算法原理而缺乏工程深度,或聚焦应用部署而回避训练核心,难以为实际构建大模型的技术团队提供系统而全面的指导。 本书正是在这一背景下应运而生。全书聚焦国产主流开源模型的训练实践,系统梳理了从理论基础到工程落地的完整技术链路,致力于为读者构建一套可迁移、可复用的知识体系。 本书在内容组织上遵循“方法论优先”的原则。技术发展日新月异,特定模型的实现细节可能很快过时,但训练方法论的核心思想具有持久的价值。因此,本书着重提炼具有普适性的设计原则和优化策略,使读者能够将所学知识迁移到不同的模型架构和技术框架中。 通过对比分析DeepSeek的 MoE架构与 MLA机制、Qwen的混合思考模式与多模态融合、GLM的智能体原子能力、KimiK2的万亿参数训练...
聚焦DeepSeek、Qwen、GLM、Kimi等国产主流开源模型,案例丰富,讲解细致。
查看详情

