图书前言

行业名家力荐

本书是一本兼具理论深度与工程落地价值的佳作。全书从Transformer核心架构讲起,循序渐进地覆盖BERT微调、预训练实战、ChatGPT/GPT-4生态应用,再延伸至ViT、CLIP、DALL-E 3与Stable Diffusion等视觉生成技术,完整串联自然语言处理与计算机视觉两大领域。书中搭配大量基于Hugging Face的可复现代码,将复杂的多模态技术拆解为清晰的实操步骤,既能帮助开发者夯实Transformer底层原理,也能为工业级多模态项目提供可落地的方案参考,是多模态技术从业者不可多得的案头读物。

杨欢|零一万物 多模态技术负责人

本书体系完整,兼顾技术原理与商业落地,非常适合AI创业团队与架构师参考。全书以Transformer架构为根基,既详解BERT、RoBERTa、GPT系列模型的微调与预训练方法,也深度拆解GPT-4V、DALL-E 3、Stable Diffusion等主流多模态工具的应用方案。书中配套的Hugging Face实战项目覆盖文本、图像、视频多场景,能帮助技术团队快速将大模型能力转化为产品功能,大幅降低多模态技术落地门槛,是一本拿来即用的工程实战手册。

苏洋|灵心巧手 联合创始人

兼首席AI架构师

面向企业级大模型应用落地,本书提供了体系化的技术路径。全书从Transformer基础理论出发,完整覆盖NLP下游任务、模型微调、嵌入与RAG方案,再延伸至多模态视觉生成与模型风险管理,逻辑清晰、层层递进。书中既有对主流模型架构的深度解析,也包含大量基于Hugging Face与OpenAI API的企业级实战案例,对各行业AI架构设计与业务落地具有很强的参考价值,是助力企业数字化转型、落地大模型应用的优质读物。

卢菁|中移信息技术有限公司

AI主任架构师

作为深耕开源大模型生态的从业者,我认为这本书是Hugging Face开发者的绝佳进阶读物。全书以Transformer为核心主线,从模型架构、分词器原理,到微调、预训练全流程,均配套Hugging Face Transformers库的实战代码,手把手复现经典NLP任务。本书突破文本领域范畴,进一步延伸至ViT、Stable Diffusion、DALL-E 3等多模态技术,结合开源工具给出完整落地方案,兼顾初学者体系构建与资深工程师的工程化参考需求。

王铁震|前Hugging Face工程师

vLLM社区贡献者

对于想要系统了解大模型与多模态基础技术的开发者而言,这本书是一份清晰的学习路线图。全书从Transformer基础原理讲起,循序渐进地覆盖NLP核心任务、模型微调与预训练、大模型嵌入与RAG,再拓展至视觉Transformer、生成式AI与多模态应用,知识体系完整且梯度合理。每一章都配套理论讲解、代码实战与思考题,搭配翔实的拓展资料。技术人员既能按部就班地系统学习,也能按需查阅解决项目问题;本书堪称自我提升的优质读本。

刘洋|启明星辰大模型工程师

CSDN 2025博客之星第一名

译 者 序

AI领域正在经历一场由Transformer架构引领的革命。从自然语言处理到计算机视觉,多模态大模型展现出前所未有的通用能力,深刻重塑技术应用边界。本书第3版的面世恰逢其时,书中系统呈现了这一变革的核心脉络与实践路径。

作为一本覆盖Transformer全生态的权威著作,本书的独特价值在于其“理论筑基—工程实践—前沿探索”的三重完整架构,恰好契合了国内读者从入门到精通的学习需求。本书以“三位一体”的视角展开,包括理论基础 (Transformer架构、注意力机制)、技术演进 (BERT、GPT、T5等模型的迭代)和跨模态融合 (GPT-4V、DALL-E3、Stable Diffusion等视觉生成技术)。尤为可贵的是,作者不仅剖析了Hugging Face、OpenAI等生态工具链的实践方法,更深入探讨了微调、提示工程、模型可解释性等关键议题,为开发者提供从理论到落地的完整路线图。

本书第3版的新增内容凸显两大趋势。

(1) 多模态融合的深化:GPT-4V与DALL-E 3的集成标志着文本与图像的语义协同进入新阶段,书中通过视觉Transformer(ViT)、CLIP等模型详解了这一融合的技术本质。

(2) 生成式AI的产业化挑战:新增的“大模型风险”内容直面幻觉、安全、伦理等现实问题,并结合RAG、RLHF等技术提出解决方案,体现了对技术与社会责任的并重。

在人工智能技术的发展日新月异的今天,译者坚信,这本凝聚了理论深度与实践温度的著作,将成为连接国内外多模态技术创新的重要桥梁。本书不仅能帮助技术从业者快速掌握Transformer架构的核心原理与实操技能,更能为企业决策者提供产业落地的清晰路径。愿每一位读者都能通过本书,在多模态大模型的浪潮中把握机遇,将技术创新转化为实实在在的价值。

本书既适合希望掌握Transformer核心原理的研究者,也为从事AIGC应用开发的工程师提供了Hugging Face微调、AutoTrain视觉训练等实战指导。在AGI曙光初现的今天,理解这些技术不仅关乎工具使用,更是把握人机协同新范式的关键。

感谢清华大学出版社的信任。限于译者水平,对书中存在的疏漏之处敬请读者指正。愿此书成为读者探索AI疆域的一块基石。如果读者发现错误,欢迎提出建议和反馈。

作 者 简 介

丹尼斯·罗斯曼(Denis Rothman)毕业于索邦大学(Sorbonne University)和巴黎狄德罗大学(Paris Diderot University),主导设计了最早的专利编码和嵌入系统之一。他曾获得专利认证,成为研发AI认知机器人与聊天机器人的先行者。丹尼斯的职业生涯始于为法国酩悦香槟(Mo t et Chandon)开发自然语言处理聊天机器人系统,以及担任空中客车公司的AI战术防御优化方案架构师。

而后,丹尼斯在IBM负责为多家奢侈品公司开发AI资源优化系统,这项成果最终演化为全球广泛应用的APS(Advanced Planning and Scheduling,先进计划与调度)解决方案。

致 谢

我要特别感谢自初始阶段便将重任托付给我,与我共同开发AI解决方案并共担持续创新风险的合作企业。同时,感谢家人对我一贯的信任与支持,这份力量一直支撑着我走过职业生涯的每一段旅程。

——丹尼斯·罗斯曼

审稿人简介

乔治·米哈伊拉(George Mihaila)拥有7年的Transformer模型研究经验,自Transformer模型于2017年问世以来一直投身于相关研究之中。目前,乔治正在攻读计算机科学专业博士(将于2027年毕业),主要研究方向为自然语言处理领域的Transformer模型,研究涵盖生成式与预测式两类自然语言处理的建模范式。

乔治拥有超过6年的顶尖企业从业经历,深度参与Transformer模型和机器学习相关工作,技术领域覆盖自然语言处理、计算机视觉、模型可解释性及因果关系研究。乔治担当科学家与工程师双重角色,是能够统筹研发全流程的机器学习专家,领导过从技术研究、开发、MLOps、性能优化到生产部署的全生命周期管理工作。

作为技术审稿人,乔治参与了丹尼斯·罗斯曼所著的《多模态大模型应用解决方案》第1版和第2版的审稿工作。

前 言

Transformer驱动的生成式AI(Generative AI)模型为自然语言处理(Natural Language Processing,NLP)和计算机视觉领域带来了革命性突破。基于大模型的生成式AI Transformer模型通过集成文本、图像、数据科学等数百个领域功能的ChatGPT GPT-4V服务,已经展现出超越人类认知水平的性能。从最初的基础生成式AI到获得超越人类的智能水平,这一进化仅仅用了数年时间!

语言理解能力已经成为构建语言模型、聊天机器人、个人助手、智能问答、文本摘要、语音转写、情感分析和机器翻译等技术的核心支柱。随着大语言模型(Large Language Model,LLM)向多模态(文本、图像、音频)算法的拓展进程,AI已迈入一个全新纪元。

过去数年间,人类活动经历了规模空前的数字化转型。社交网络逐渐取代线下聚会,电子商务超越实体零售,数字新闻淘汰印刷媒体,流媒体平台接管院线市场,远程诊疗改变传统就医,居家办公替代现场办公,这些演变覆盖数百个专业领域。当下,以Transformer框架为核心的AI应用正在数字化场景中发挥着愈加重要的驱动作用。

虽然Transformer架构仅问世数年,但其革命性和颠覆性效应已然重塑行业格局。Transformer彻底终结了RNN和CNN主导的时代,BERT和GPT模型摒弃传统的循环网络层,转而采用自注意力机制实现突破。2023年推出的OpenAI GPT-4V视觉Transformer更具划时代意义,该技术通过整合日常任务功能,正在为通用人工智能(Artificial General Intelligence,AGI)的实现铺平道路。紧跟其后的Google Vertex AI也提供了相似类型的技术方案。2024年对于AI发展史非比寻常,并非简单的年份更替,而是标志着一个全新十年的开启!Meta(前身为Facebook)发布的Llama 2模型实现了与Hugging Face平台的无缝对接,进一步降低了技术应用门槛。

在技术实现层面,Transformer的编码器和解码器都配备了采用独立训练机制的注意力头模块,这种设计使其能够充分发挥各类尖端硬件的并行运算优势。由于各注意力头可独立运行于不同GPU,这种架构突破不仅支撑了当前普遍应用的百亿参数级别模型,也为即将到来的万亿参数模型时代敞开了技术大门。

日益增长的数据量要求对AI模型进行大规模训练。在此背景下,Transformer模型推动了参数驱动型AI的新时代。为了理解数亿单词和图像之间的组合逻辑,需要海量的模型参数。Google Vertex AI PaLM 2和OpenAI GPT-4V等Transformer模型已然将模型的涌现能力提升至全新高度。令人惊叹的是,Transformer能够完成数百项在训练时并未涉及的NLP任务。

更引人注目的是,Transformer还能通过将图像编码为文字序列的方式实现图像分类和图像重建。本书将重点介绍前沿的计算机视觉Transformer模型,包括视觉Transformer(Vision Transformers,ViT)、CLIP、GPT-4V、DALL-E 3以及Stable Diffusion等技术。

不妨设想这样的场景:社交网络每天产生数十亿条信息流,若要在信息提取前确保内容的合法合规,需要多大规模的审核团队?

考虑到网络上每日更新的数百万个网页需要翻译,这又将需要怎样的翻译团队规模?更令人震撼的是,每分钟生成的数百万条消息和图像,如果仅依赖人工审核监控,这将需要多么庞大的人力资源配置。

当我们继续扩展这个想象:所有网络平台每日新增的海量流媒体内容(如视频直播和录音资料),如果全部依赖人工转录会产生怎样的需求?最后,互联网每时每刻出现的数以亿计的图像,如果用人工标注代替AI自动化处理,其所需的人力成本将是天文数字。

本书将引领读者从传统的编程开发拓展到提示工程,后者是一种新型的“编程”技能,专注于控制Transformer模型的行为模式。本书的每章内容都从零开始,带领读者基于Python、PyTorch和TensorFlow生态,逐步掌握语言理解与计算机视觉的核心技术。

读者将深入剖析原始Transformer、Google BERT、GPT-4、PaLM 2、T5、ViT以及Stable Diffusion等经典模型的结构设计。通过学习,读者不仅能掌握模型微调技巧,还能从零开始训练模型,并熟练运用各类强大的API接口。

读者将了解各类应用市场的核心需求,深度理解传媒、社交媒体及学术研究等领域的语言理解挑战。通过动手实践,读者将掌握检索增强生成(Retrieval Augmented Generation,RAG)、嵌入向量搜索、提示工程等前沿技术,并学习运用AI生成的提示词自动激发创意的方法论。

本书的代码实践基于Python、PyTorch和TensorFlow展开。本书首先系统分析有助于理解神经网络的核心模型架构,随后深入探究Transformer模型的实现原理。

通过学习本书,读者不仅能快速适应产业现状,更能开拓视野,从容应对创新项目需求和技术演变。本书致力于培养读者的双重能力,既要建立扎实的模型知识体系,又要形成清晰的技术选型逻辑,从而为不同项目量体裁衣,选择出最优方案。

目标读者

本书面向具备Python开发和基础机器学习知识的读者,重点聚焦深度学习在NLP及多模态领域的核心场景,涵盖机器翻译、语音识别、对话系统、语言建模等技术模块解析,同步结合计算机视觉领域的最新应用实践。

本书特别适合以下读者:

熟悉Python的深度学习、计算机视觉及NLP工程师。

需要处理海量文本/图像数据的数据分析师、数据科学家、机器学习工程师和AI工程师。

本书内容框架

第Ⅰ篇:Transformer基础

第1章“Transformer简介”,完整揭示了引发AI范式革命的Transformer架构和基础模型。该章首先剖析Transformer模型时间将复杂度压缩至O(1) 的关键突破,阐述这个在工程实现中极具优势的特性如何撼动传统的序列建模范式。继而梳理Transformer架构的发展轨迹,从2017年鲜为人知的论文Attention is All You Need,到催生出当今AI基础模型的产业变革力量。

第2章“Transformer模型架构入门”,从NLP的发展背景切入,解析业界为何逐步摒弃RNN、LSTM和CNN,以及Transformer架构如何开启新时代。该章将依托Google Research和Google Brain团队的开创性论文Attention is All You Need,深入探讨原始Transformer的架构。该章不仅讲解Transformer的理论基础,还将通过Python实战演示多头注意力的子层实现过程。

第3章“智能涌现与下游任务”,通过引入涌现概念,衔接Transformer的功能与数学架构。该章首先探讨Transformer的性能评估方法,进而解析若干典型的下游任务,包括斯坦福情感树库(Stanford Sentiment TreeBank,SST-2)、语言可接受性、Winograd模式匹配。

第4章“机器翻译”,采取三阶式学习路径。首先明确机器翻译的基本概念,接着对机器翻译研讨会(Workshop on Machine Translation,WMT)数据集进行预处理,最后完成翻译系统的完整实现。

第5章“利用BERT进行微调”,在原始Transformer架构的基础上深入探索。双向编码器表征Transformer(Bidirectional Encoder Representations from Transformers,BERT)为NLP领域带来革命性突破。BERT摒弃了传统的序列预测方式,转而采用全序列全景感知机制。该章将剖析BERT架构的关键创新点,并通过Google Colaboratory云端笔记逐步实现模型微调。值得注意的是,BERT如同人类的学习机制,不必从头开始学习特定领域知识,即可具备跨任务迁移能力。

第6章“使用RoBERTa对Transformer进行预训练”,使用Hugging Face的PyTorch模块从零构建RoBERTa模型。RoBERTa模型兼具BERT与DistilBERT特性。首先,该章基于定制数据集训练分词器,然后利用X(原Twitter)的数据来预训练生成式AI客户支持模型。

第Ⅱ篇:超级NLP的崛起

第7章“ChatGPT生成式AI革命”,详细阐述了ChatGPT的技术突破及其对开发者和终端用户日常生活的深远影响。该章首先剖析OpenAI的GPT模型架构,随后通过GPT-4 API及其超参数配置实现多个NLP示例。最后,系统介绍了如何通过检索增强生成(RAG)技术优化结果质量,并实际部署基于GPT-4的自动RAG应用示例。

第8章“微调OpenAI GPT模型”,深度解析模型微调对项目研发路径决策的影响,引入项目风险管理的关键方法论。该章涵盖从数据集准备到实际微调高效babbage-02模型的全流程,以完成特定任务优化目标。

第9章“模型可解释性”,通过多维可视化技术揭示Transformer模型的内部工作机制。该章利用BertViz工具可视化注意力头结构,并采用语言可解释工具(Language Interpretability Tool,LIT)进行主成分分析(Principal Component Analysis,PCA),运用LIME通过字典学习方法解释Transformer工作机制。在此基础之上,该章还将使用OpenAI大模型深入探索具有交互界面的Transformer神经元活动,这种创新方法为后续的“GPT-4解释Transformer”等前沿研究指明方向。

第10章“分词器在Transformer中的作用”,系统讲解与分词器无关的分词器最佳评估实践。首先,从分词的专业视角提出数据集与分词器的基础性规范。随后,针对词与子词,对比不同分词器的技术特性,最终通过完整试验展示分词器配置对Transformer模型训练流程与性能表现的显著影响。为提升工程可操作性,该章还实现了token-ID映射关系的可视化函数。

第11章“利用大模型嵌入进行微调”,揭示了嵌入检索作为微调替代方案的有效应用场景,系统解析该方案的优缺点。该章首先阐释文本嵌入的核心机理,接着通过Gensim和Word2Vec实现文件读取、分词与嵌入处理的完整系统。实践环节包含两个示例:体育赛事智能问答系统,以及使用OpenAI Ada完成亚马逊美食评论嵌入分析。结尾处完整展示了从基础提示词设计到基于嵌入技术的高级提示工程实现,最终构建完整的RAG系统。

第12章“使用ChatGPT和GPT-4进行标注”,探讨了无语法、非重复性随机模型的创新性概念。通过GPT-4增强版ChatGPT Plus,实施从基础到复杂的语义角色标注(Semantic Role Labeling,SRL)试验。观察通用型涌现模型如何响应SRL请求。然后,逐步将Transformer模型推向SRL能力的极限。

第13章“使用T5和ChatGPT生成摘要”,首先解析T5 Transformer的架构创新与训练范式,借助Hugging Face模型库在法律文书和医学报告等专业领域生成精细化摘要。区别于简易示例,该章立足于构建企业级NLP实施方案,重点突破限定领域文本处理的实践挑战。最终,通过建立双模型对照组,定量对比T5与ChatGPT在维度压缩与语义保持层面的性能差异。

第14章“使用Vertex AI与PaLM 2探索前沿大模型”,通过Google Pathways分布式系统解析PaLM的技术演进路径。聚焦于具备5400亿个参数的自回归Transformer巨量模型——Pathways语言模型(Pathways Language Model,PaLM)的三大技术特征:纯解码器架构、密度激活机制与并行训练系统。实战环节通过Vertex AI的PaLM 2 API开发多功能NLP系统,覆盖对话、分类、文本生成等场景,并构建医疗问答与新闻摘要行业解决方案。最后,完整演练Google Cloud平台的大模型微调工作流。

第15章“大模型风险”,系统剖析了大模型的潜在风险及管理策略。该章详述了幻觉、记忆、智能涌现、虚假信息、影响力操控、有害内容、对抗攻击(“越狱”)、隐私泄露、网络安全威胁、过度依赖等多重风险维度。然后,通过前沿的提示工程探讨应对措施,包括内容审核模型、构建专业知识库、关键词解析引擎、提示词助手、后处理审核系统,以及嵌入优化技术的工程实践。

第Ⅲ篇:生成式计算机视觉

第16章“视觉Transformer”,聚焦于创新的Transformer架构。视觉Transformer模型既沿袭原始Transformer,又通过ViT、CLIP、DALL-E和GPT-4V等创新成果实现范式突破。该章以GPT-4V为示例展开代码实践,并将DALL-E 3的图文交互逻辑拓展至高度发散式语义关联领域,将OpenAI模型带入高度发散式语义关联的新兴领域。

第17章“Stable Diffusion”,深入解析引发生成式图像AI产业变革的扩散模型技术。该章将以引发市场颠覆性创新的Keras Stable Diffusion模型为样本,剖析其数学原理、工程架构及实现代码。通过逐层解构模型核心组件,结合Keras官方源代码指导的实战演练,完整揭示了Stable Diffusion技术的运行机制。该章还包含两类前沿应用:借助Hugging Face平台实现文本—视频生成,以及运用Meta的TimeSformer完成视频—文本语义解析。

第18章“使用Hugging Face AutoTrain训练视觉模型”,展示如何利用Hugging Face AutoTrain实现视觉Transformer的自动化训练。通过对标准化训练流程的完整追溯,揭示了为什么AutoML系统仍需要专业AI工程师的介入。该章的终极目标是建立技术批判思维,即无论AI系统如何进化,开发者都应具备探索其边界的能力。

第19章“借助HuggingGPT及同类模型迈向AGI”,展示了如何运用跨平台链式模型攻克复杂图像分类难题。该章使用HuggingGPT和Google Cloud Vision,分别处理简单、困难及超高难度的图像识别任务。该章不仅构建经典流水线,更深入探索如何将异构竞争模型进行链式编排。

第20章“使用生成式创意设计提示词”,重点解读生成式创意生态,实现从构想到文本/图像的全自动内容生成系统。开发阶段需要资深AI专家的深度参与,而最终用户只需单击一次即可运行整套系统。学完本章后,企业无论营销资源配置如何,均可部署符合伦理规范且独具创造力的生成式解决方案。通过搭建一个前沿、创新且坚守伦理的技术生态,将生成式创意方法扩展至所有商业领域。

附录A“Transformer模型的时间复杂度”,详解Transformer的O(1)时间复杂度的技术实现、基础原理,以及其相较于传统O(n)算法的突破性优势。该附录同时解析了Transformer架构中的词元到词元(Token-to-Token)处理机制。

附录B“练习题参考答案”,提供各章结尾所有问题的答案。

本书最佳实践指南

本书的绝大多数示例采用代码笔记本形式呈现。读者仅需注册免费Google Gmail账户,即可通过Google Colaboratory的免费云端虚拟环境运行所有示例代码。

推荐重点研读第2章“Transformer模型架构入门”。该章系统阐述了原始Transformer的核心技术细节。若读者初次阅读有理解障碍,建议重点掌握核心概念。在学习其他Transformer应用章节后,可随时返回第2章深化理论认知。

完成每一章学习后,建议结合实际业务场景思考如何在客户场景落地Transformer技术方案,以及如何将书中的创新方法融入工作,实现职业突破。

下载示例代码文件和彩图

本书提供示例代码文件和彩图,可扫描下面的二维码获取。