大语言模型基础(微课视频版)
深入浅出地讲解从注意力机制到人类对齐与评测实践的知识 配套9章教学课件,590分钟视频讲解,教学大纲

作者:孙弋 主编,王安义、孙龙杰、田丰、陈旸、孙骁尧 副主编

丛书名:跟我一起学人工智能

定价:69元

印次:1-1

ISBN:9787302721031

出版日期:2026.08.01

印刷日期:2026.07.17

图书责编:赵佳霓

图书分类:教材

电子书
在线购买
分享
内容简介
作者简介
前言序言
资源下载
查看详情 查看详情 查看详情

本书以Transformer模型为核心,全面覆盖大语言模型的构建与应用全流程,包括深度学习基础、注意力机制、预训练语料处理、数据表征、扩展法则、架构优化、预训练、微调、推理、人类对齐及评测等关键环节。内容兼顾理论深度与实践指导,通过数学推导、算法解析、代码实现及案例分析,为读者提供清晰的学习路径。 全书共9章,第1章介绍Transformer模型的理论基础与代码实现,第2~4章探讨预训练语料、数据表征及扩展法则与架构设计,第5~7章深入预训练、微调与推理的优化技术,第8章聚焦人类对齐的理论与实践,第9章系统介绍评测方法。 本书面向高校学生、研究人员及人工智能领域从业者,注重前沿技术与**研究成果结合,适合作为人工智能、计算机科学相关专业的教材,也可作为自然语言处理及大语言模型开发者的参考书。通过阅读本书,读者可以掌握大语言模型的核心知识与基础研究框架,为学术研究与技术应用奠定坚实基础。

孙弋 教授、工学博士,长期从事信息学科教学与智能软硬件产品的研究开发工作。信息技术与人工智能领域技术博主,跟踪相关领域前沿技术与框架,并在各大媒体平台分享相关视频,受广大网友好评。

前言 随着人工智能技术的迅猛发展,大语言模型(Large Language Model,LLM)已成为自然语言处理领域的核心驱动力。从机器翻译、对话系统到知识问答,大语言模型在众多任务中展现出强大的性能,深刻改变了人类与信息的交互方式。作为推动这一技术浪潮的核心,Transformer模型及其衍生架构以其高效的并行计算能力和强大的上下文建模能力,成为大语言模型研究与应用的基础支柱。与此同时,预训练、微调、推理优化及人类对齐等技术的发展,进一步地提升了大语言模型的性能与实用性,使其在学术研究与产业应用中均占据重要地位。 然而,大语言模型的复杂性与快速发展也为学习者带来了挑战。相关技术涉及深度学习、数学建模、算法优化及工程实现等多个领域,知识体系庞大且更新迅速。如何系统地掌握大语言模型的理论基础与研究方法,成为相关领域高校学生、研究人员及工程技术人员面临的共同问题。为此,本书的编写旨在为读者提供一部结构清晰、内容全面、理论与实践兼备的入门教材,帮助其快速建立对大语言模型的整体理解,并为后续研究与开发提供指导。 本书以Transformer模型为核心,全面地介绍了大语言模型的理论基础、技术细节与工程实践。全书共9章,涵盖了从基础理论到前沿应用的完整知识体系。第1章从深度学习与注意力机制入手,详细剖析Transformer模型的关键技术与代码实现。第2~4章聚焦数据与模型的核心环节,包括预训练语料的构建与处理、数据表征的演进,以及扩展法则与架构优化。第5~7章深入探讨大语言模型的预训练、微调与推理过程,结合数学推导与算法实现,揭示模型优化的核心方法。第8章讨论人类对齐的理...

目录
荐语
查看详情 查看详情
目录

第1章Transformer模型基础(90min)1

1.1深度学习1

1.1.1深度学习基础1

1.1.2语言模型及其演变11

1.2注意力机制14

1.2.1注意力机制的定义14

1.2.2注意力机制的分类16

1.2.3注意力机制的数学原理19

1.2.4注意力机制的变体23

1.2.5注意力机制的应用27

1.3Transformer模型的关键支撑技术29

1.3.1归一化方法29

1.3.2激活函数31

1.3.3位置编码36

1.4Transformer基础模型的代码实现39

1.4.1输入编码模块代码实现39

1.4.2多头自注意力机制模块代码实现40

1.4.3位置前馈网络代码实现44

1.4.4残差连接与层归一化代码实现45

1.4.5编码器代码实现46

1.4.6解码器代码实现48

第2章大语言模型训练语料(45min)54

2.1预训练目标与方法54

2.1.1语言建模54

2.1.2上下文理解56

2.1.3知识获取57

2.1.4多任务学习57

2.2预训练语料58

2.2.1预训练语料的定义58

2.2.2预训练语料的来源60

2.2.3语言覆盖63

2.2.4数据规模65

2.3语料预处理67

2.3.1语料去噪67

2.3.2低质过滤68

2.3.3冗余去除69

2.3.4隐私消除70

2.3.5词元切分70

2.4语料调度71

2.4.1语料调度的定义71

2.4.2语料调度的基本原则和方法72

2.4.3预训练案例73

第3章大语言模型数据表征... 查看详情

■理论基础扎实  从深度学习的基本原理入手,系统而详尽地阐述了神经网络、激活函数、梯度下降方法等核心概念,为读者构建了坚实且全面的理论基础,帮助读者深入理解大语言模型的底层逻辑。 ■知识内容全面  内容涵盖了Transformer架构、注意力机制、预训练语言模型、微调技术、人类对齐及模型评测实践等多个方面,系统梳理了大语言模型的完整技术链条,覆盖从理论到应用的各个环节。 ■结构逻辑清晰  章节组织严谨,内容由浅入深,层层递进,从语言模型的历史演变到现代优化技术,逻辑清晰,便于读者循序渐进地掌握复杂技术知识。

查看详情