


定价:79元
印次:1-1
ISBN:9787302718352
出版日期:2026.06.01
印刷日期:2026.06.03
图书责编:赵佳霓
图书分类:教材
"本书以理论为核心,辅之以代码示例,遵循自底向上的逻辑,依次详细介绍了神经网络、Transformer架构、传统语言模型及现如今常见的大语言模型(Large Language Models,LLM),引导读者渐进式地学习LLM的底层原理和上层应用,了解从传统语言模型到LLM的演变过程,使读者在参与LLM相关的学术研究和工程实践时更加得心应手。 本书共12章。第1章简要介绍LLM的基本概念;第2~4章介绍深度学习的基本原理和代码实现;第5章介绍在自然语言处理中的基本概念;第6章从Encoder-Decoder架构出发介绍Transformer架构;第7~9章介绍基于Transformer架构的预训练语言模型;第10章介绍LLM发展历程中两个具有里程碑地位的语言模型GPT-3和T5;第11章详细阐述现代LLM的构建方式;第12章介绍LLM的两大应用,即提示工程和模型上下文协议。 本书在叙述知识和概念时均从初学者的直觉出发,适合没有人工智能基础的初学者入门,只要求读者具备基本的代码能力。书中创新性的分析角度和细致的代码示例对于有经验的研究人员和工程师也有一定参考价值,并可作为高等院校和培训机构相关专业的教学参考书。 "
前言 在人工智能技术迅猛发展的浪潮中,大语言模型(LLM)作为AI领域的璀璨明珠,正深刻改变着人类与技术交互的方式。从智能对话助手到内容创作工具,从代码生成到知识推理,LLM的应用已渗透到各个领域,展现出惊人的潜力。然而,其背后复杂的技术体系,从基础的神经网络原理到Transformer架构,从预训练技术到微调策略,却让许多开发者和学习者望而却步。 本书以LLM为核心,从神经网络基础原理出发,逐步深入Transformer架构、预训练与微调技术,最终落脚于实际应用与前沿探索。无论是AI领域的初学者,还是希望深入理解LLM的开发者都能通过本书循序渐进地掌握这一前沿技术,在AI浪潮中占据先机。在撰写过程中,笔者查阅了大量权威文献与官方资料,结合实际项目案例,力求内容兼具深度与实用性,这一过程也让笔者对LLM技术有了更深刻的理解与思考。 本书主要内容 第1章从生成式人工智能的基础概念入手,剖析判别任务与生成任务的区别,详解自回归式生成的原理。进而介绍LLM的核心原理与演进历程,分析其能力与局限,为读者建立对LLM的基本认知。 第2章系统讲解深度学习的基本范式,深入剖析全连接神经网络、卷积神经网络、递归神经网络等常见结构。介绍神经网络的衡量标准与优化方法,为理解LLM的底层架构奠定基础。 第3章详细指导如何在云端交互式计算环境、Linux系统及Windows系统中搭建深度学习环境,包括工具安装、配置优化等,帮助读者快速构建开发实践平台。 第4章聚焦张量与张量运算,讲解如何使用PyTorch构建神经网络,通过案例演示模...
目录
本书源码
第1章大语言模型简介
1.1生成式人工智能
1.1.1判别任务与生成任务
1.1.2自回归式生成
1.1.3判别与生成的边界
1.2LLM原理概述
1.2.1ChatGPT简介
1.2.2GPT模型的发展历程
1.2.3GPT模型的指令微调
1.2.4GPT模型的可控生成
1.3LLM的能力与局限
1.3.1知识能力
1.3.2算术能力
1.3.3代码能力
1.4本章小结
第2章神经网络基本原理
2.1深度学习基本范式
2.1.1一切皆函数
2.1.2机器学习基本范式
2.1.3神经网络与深度学习
2.2神经网络的结构
2.2.1全连接神经网络
2.2.2卷积神经网络
2.2.3残差连接和批量归一化
2.2.4递归神经网络
2.3神经网络的衡量标准
2.3.1监督学习目标
2.3.2半监督学习目标
2.3.3强化学习目标
2.4神经网络的优化
2.4.1前向传播和反向传播
2.4.2梯度下降方法
2.4.3模型性能的评估
2.4.4模型的过拟合
2.5本章小结
第3章深度学习环境搭建
3.1使用云端交互式计算环境
3.1.1Jupyter的本地部署和基本操作
3.1.2Colab的使用方法
3.1.3在Kaggle中使用笔记本
3.2在Linux计算机上搭建深度学习环境
3.2... 查看详情





