本书以Transformer模型为核心,全面覆盖大语言模型的构建与应用全流程,包括深度学习基础、注意力机制、预训练语料处理、数据表征、扩展法则、架构优化、预训练、微调、推理、人类对齐及评测等关键环节。内容兼顾理论深度与实践指导,通过数学推导、算法解析、代码实现及案例分析,为读者提供清晰的学习路径。
全书共9章,第1章介绍Transformer模型的理论基础与代码实现,第2~4章探讨预训练语料、数据表征及扩展法则与架构设计,第5~7章深入预训练、微调与推理的优化技术,第8章聚焦人类对齐的理论与实践,第9章系统介绍评测方法。
本书面向高校学生、研究人员及人工智能领域从业者,注重前沿技术与**研究成果结合,适合作为人工智能、计算机科学相关专业的教材,也可作为自然语言处理及大语言模型开发者的参考书。通过阅读本书,读者可以掌握大语言模型的核心知识与基础研究框架,为学术研究与技术应用奠定坚实基础。
