目录
第1章Transformer模型基础(90min)1
1.1深度学习1
1.1.1深度学习基础1
1.1.2语言模型及其演变11
1.2注意力机制14
1.2.1注意力机制的定义14
1.2.2注意力机制的分类16
1.2.3注意力机制的数学原理19
1.2.4注意力机制的变体23
1.2.5注意力机制的应用27
1.3Transformer模型的关键支撑技术29
1.3.1归一化方法29
1.3.2激活函数31
1.3.3位置编码36
1.4Transformer基础模型的代码实现39
1.4.1输入编码模块代码实现39
1.4.2多头自注意力机制模块代码实现40
1.4.3位置前馈网络代码实现44
1.4.4残差连接与层归一化代码实现45
1.4.5编码器代码实现46
1.4.6解码器代码实现48
第2章大语言模型训练语料(45min)54
2.1预训练目标与方法54
2.1.1语言建模54
2.1.2上下文理解56
2.1.3知识获取57
2.1.4多任务学习57
2.2预训练语料58
2.2.1预训练语料的定义58
2.2.2预训练语料的来源60
2.2.3语言覆盖63
2.2.4数据规模65
2.3语料预处理67
2.3.1语料去噪67
2.3.2低质过滤68
2.3.3冗余去除69
2.3.4隐私消除70
2.3.5词元切分70
2.4语料调度71
2.4.1语料调度的定义71
2.4.2语料调度的基本原则和方法72
2.4.3预训练案例73
第3章大语言模型数据表征(77min)75
3.1语言数据表征的历史演进75
3.1.1基于规则和统计的方法75
3.1.2词嵌入76
3.1.3上下文感知的词嵌入77
3.1.4多模态表征78
3.2语言数据表征与信息表示79
3.2.1数据表征的基本概念79
3.2.2数据表征理论基础81
3.3词嵌入技术83
3.3.1词嵌入技术的数学基础83
3.3.2Skipgram模型83
3.3.3CBoW模型84
3.3.4词嵌入模型实现的关键技术86
3.4句子与篇章嵌入技术92
3.4.1静态句子嵌入技术93
3.4.2上下文句子嵌入96
3.5多模态表征技术102
3.5.1共享嵌入空间103
3.5.2CLIP: 图文对比学习106
3.5.3ViLBERT: VisionandLanguage BERT108
3.6具身智能表征技术113
3.6.1具身智能基本概念与原理113
3.6.2具身智能表征方法114
3.6.3具身智能表征技术应用115
第4章大语言模型训练的扩展法则和架构(67min)117
4.1扩展法则概述117
4.2扩展法则的数学建模120
4.2.1模型规模对性能的影响120
4.2.2训练数据规模对性能的影响122
4.2.3计算量对性能的影响124
4.2.4综合扩展法则的联合优化126
4.3大语言模型主流扩展法则129
4.3.1KaplanMcCandlish 扩展法则129
4.3.2Chinchilla 扩展法则130
4.4大语言模型架构131
4.4.1编码器解码器架构131
4.4.2仅编码器架构134
4.4.3仅解码器架构136
4.5架构优化技术140
4.5.1稀疏注意力机制140
4.5.2模型并行化143
4.5.3混合专家模型146
4.6扩展法则与架构的协同设计150
4.6.1架构对扩展法则的影响150
4.6.2基于扩展法则的架构优化153
第5章大语言模型预训练(74min)156
5.1预训练概述156
5.2预训练任务158
5.2.1掩码语言模型159
5.2.2因果语言模型162
5.2.3序列到序列任务164
5.3预训练优化167
5.3.1学习率调度167
5.3.2梯度裁剪170
5.3.3混合精度训练172
5.4因果解码器模型预训练参数量计算与效率分析174
5.4.1大语言模型参数量计算175
5.4.2大语言模型预训练运算量计算177
5.4.3大语言模型预训练时间计算180
5.4.4大语言模型预训练显存计算182
第6章大语言模型微调(63min)187
6.1微调的基本概念187
6.1.1微调的定义与目标187
6.1.2微调与预训练的区别188
6.1.3微调的应用场景190
6.2微调技术191
6.2.1全参数微调191
6.2.2提示微调194
6.2.3部分参数微调197
6.2.4高效微调技术207
6.3微调策略216
6.3.1数据准备216
6.3.2训练过程优化218
6.3.3多任务与多语言微调220
第7章大语言模型推理(59min)224
7.1推理原理224
7.1.1推理的定义与类型224
7.1.2大语言模型中的推理任务226
7.2推理方法基础227
7.2.1基于规则的推理228
7.2.2概率推理230
7.2.3思维链推理232
7.2.4自回归推理236
7.3推理算法238
7.3.1解码控制算法238
7.3.2结构化生成算法246
7.3.3复杂推理增强249
7.4推理优化技术257
7.4.1计算资源优化257
7.4.2模型结构优化262
7.4.3系统级优化265
第8章人类对齐(68min)269
8.1人类对齐概述269
8.1.1人类对齐基础知识269
8.1.2人类对齐问题背景271
8.1.3人类对齐目标272
8.2人类对齐方法275
8.2.1人类对齐指令微调275
8.2.2人类反馈强化学习278
8.2.3RLHF的数学原理282
8.3人类对齐评估方法294
8.3.1人类对齐评估指标294
8.3.2人类对齐综合评估框架296
8.4人类对齐案例研究299
8.4.1ChatGPT3的对齐实践299
8.4.2GPT4的对齐案例300
8.4.3LLaMA模型的对齐实践302
第9章大语言模型评测(47min)304
9.1大语言模型评测方法305
9.1.1定量评测方法305
9.1.2定性评测方法309
9.2标准基准数据集315
9.2.1基准数据集315
9.2.2基准数据集应用320
9.3大语言模型特定能力评估321
9.3.1语言理解能力321
9.3.2语言生成评估324
9.3.3推理和常识326
9.3.4世界知识329
9.3.5多模态能力331
9.4少样本和零样本评测334
9.4.1少样本和零样本评测概念334
9.4.2评估技术335
9.5稳健性和伦理考虑336
9.5.1稳健性评估336
9.5.2公平性和偏见评估337
9.5.3安全和伦理问题338
9.6评估技术实践339
9.6.1实验设置339
9.6.2统计显著性341
9.6.3评测报告343
参考文献345
