图书前言

前言

深度学习的浪潮席卷而来,尤其是大模型的兴起,不仅在学术领域持续突破边界,更在实际应用中展现出越来越强的生命力。从早期的神经网络模型到如今参数规模惊人的大模型,技术的迭代速度之快,让每个关注它的人都深感探索的必要。

目前的学习环境远比过去便利。互联网构建起了触手可及的知识网络,从经典论文中模型设计的原始灵感,到技术博客中深入浅出的拓展思考; 从视频网站中生动直观的原理讲解,到GitHub等代码仓库中可直接复现的模型代码; 从深度学习社区中实时的互动问答,到豆包、DeepSeek等AI工具精准高效的辅导。这无疑是一个学习成本极低的时代,愿我们都能利用好这些资源,在探索中少走弯路。

笔者是一名对深度学习抱有浓厚兴趣的从业者,工作之余,喜欢了解和思考深度学习和大模型的原理,经整理后总结成博文,在机缘巧合之下,这些原本只为自用的笔记,有了被整理成书的机会。这离不开身边家人及朋友的鼓励,更要感谢出版社的信任,让我有勇气把这些学习心得分享出来。结合自己的学习经历,笔者深感数学与代码相结合是理解模型原理的有效方式。从模型设计的数学逻辑,到代码的实现细节,形成完整的闭环,往往能带来更深刻的理解。当思维困于晦涩的技术原理时,分析代码并调试运行,往往会让人豁然开朗。

本书共14章,第1章为绪论,介绍大模型的背景。第2~5章,分别介绍深度学习的基础模型,这些模型成为深度学习的基本元素。

第2章多层感知机,多层感知机是神经网络最基础的模型,具有重要意义。本章介绍了神经网络的基本组成单元——神经元和激活函数,讲解神经网络基本的计算和训练过程——前向传播和误差反向传播过程。

第3章卷积神经网络,在神经网络中的卷积操作是很多目标检测、生成模型的基本构成单元。本章介绍卷积神经网络的基本原理,并详细介绍卷积、反卷积的计算过程和梯度推导,为后文介绍YOLO、GAN、VAE、扩散模型等打下基础。

第4章循环神经网络,重点介绍循环神经网络的结构、原理和变形,包括标准的循环神经网络、双向神经网络等。本章介绍序列数据的处理方法,为后文Transformer模型提供了铺垫。

第5章LSTM与GRU,介绍LSTM和GRU的结构和原理,包括输入门、遗忘门、输出门、记忆单元等组件。

这部分内容按照从简单到复杂的顺序组织,帮助读者逐步建立对神经网络模型的理解。每章都介绍模型的数学原理、架构设计、训练方法和代码案例,为后续学习更复杂的模型打下基础。

第6~8章分别介绍大模型相关的算法,包括Transformer、BERT、GPT。这些是大模型的核心技术。

第6章Transformer,介绍Transformer的核心原理,包括自注意力、交叉注意力、位置编码等组件。Transformer是绝大多数大模型所依赖的基础架构,对于理解大模型的原理具有重要意义。

第7章BERT,介绍BERT模型的原理和结构,以及与Transformer的关系。同时介绍了掩码语言模型和下一句预测等预训练任务。

第8章GPT,介绍GPT模型的原理和结构,重点介绍了GPT系列模型的演进历程,包括GPT1、GPT2、GPT3、GPT4等版本的主要技术特点。

这部分内容聚焦于Transformer架构及其在预训练模型中的应用,揭示了大模型的技术基础。通过学习这一部分内容,读者将理解Transformer为何成为大模型的核心架构,以及大模型技术中为什么预训练+微调范式成为主流。

第9~13章分别介绍针对特定任务设计的深度学习模型,帮助读者理解在不同的应用场景下发展出的不同技术路径。

第9章YOLO,介绍目标检测模型的原理和结构,包括锚框、多尺度预测、损失函数等。

第10章VAE,介绍模型的原理和应用,包括编码器、解码器、重参数化技巧、KL散度损失等核心概念。

第11章对抗神经网络,介绍模型的生成器、判别器等结构,并在案例中演示利用该模型生成图像。

第12章扩散模型,介绍扩散模型的原理和应用,包括正向扩散过程、反向去噪过程、损失函数等关键概念。扩散模型是近年来在图像生成领域表现出色的生成模型,本章在案例中演示了扩散模型生成图像的过程。

第13章强化学习,DeepMind公司凭借AlphaGo这一开创性成果,使强化学习在全球范围内引发关注。不仅如此,强化学习在大模型的训练过程中发挥了显著的增强作用,提升了大模型在处理复杂任务时的表现,因此强化学习在深度学习领域的热度持续攀升。本章介绍强化学习的基本原理,以及策略梯度、QLearning、深度强化学习等算法,并介绍了强化学习在大模型训练中的运用。

这部分内容展示了深度学习在不同任务和领域的应用,帮助读者理解如何根据具体问题选择合适的模型架构。

同时,本书基于主流的编程语言Python,使用常用的TensorFlow等模块实现模型辅以示例代码和大量注释,便于读者理解和上手。本书尽量避免照本宣科式的讲解方式,而是从模型设计理念入手,让读者了解模型如此设计的原因,知其然,知其所以然。

第14章当前人工智能的缺陷,讨论了当前人工智能的主要缺陷,以及研究人员为解决这些缺陷所提出的解决方法。

希望本书能为同样在自学深度学习和大模型的读者提供一点参考。愿我们都能在探索和学习中充实自我、有所收获,在深度学习和大模型的浪潮中跟上时代的脚步。

资源下载提示

素材(源码)等资源: 扫描封底的文泉云盘防盗码,再扫描目录上方的二维码下载。

致谢

感谢我的家人在写作过程中对我的大力支持,感谢清华大学出版社赵佳霓编辑的耐心指导与沟通。

笔者的阅历有限,书中内容难免存在疏漏,希望读者热心指正,在此表示感谢。

王翔宇

2026年6月于北京