"本书以理论为核心,辅之以代码示例,遵循自底向上的逻辑,依次详细介绍了神经网络、Transformer架构、传统语言模型及现如今常见的大语言模型(Large Language Models,LLM),引导读者渐进式地学习LLM的底层原理和上层应用,了解从传统语言模型到LLM的演变过程,使读者在参与LLM相关的学术研究和工程实践时更加得心应手。
本书共12章。第1章简要介绍LLM的基本概念;第2~4章介绍深度学习的基本原理和代码实现;第5章介绍在自然语言处理中的基本概念;第6章从Encoder-Decoder架构出发介绍Transformer架构;第7~9章介绍基于Transformer架构的预训练语言模型;第10章介绍LLM发展历程中两个具有里程碑地位的语言模型GPT-3和T5;第11章详细阐述现代LLM的构建方式;第12章介绍LLM的两大应用,即提示工程和模型上下文协议。
本书在叙述知识和概念时均从初学者的直觉出发,适合没有人工智能基础的初学者入门,只要求读者具备基本的代码能力。书中创新性的分析角度和细致的代码示例对于有经验的研究人员和工程师也有一定参考价值,并可作为高等院校和培训机构相关专业的教学参考书。
"
