多模态大模型应用解决方案:基于Hugging Face、 ChatGPT、 GPT-4V和DALL-E 3等Transformer架构的自然语言处理与计算机视觉(第3版)
深入探讨大语言模型(LLM)的架构、应用,以及用于自然语言处理(NLP)和计算机视觉(CV)的各类平台,包括Hugging Face、OpenAI和Google Vertex AI。

作者:[法] 丹尼斯·罗斯曼(Denis Rothman)著 林润 译

定价:158元

印次:1-1

ISBN:9787302723929

出版日期:2026.08.01

印刷日期:2026.08.04

图书责编:王军

图书分类:零售

电子书
在线购买
分享
内容简介
作者简介
前言序言
资源下载
查看详情 查看详情 查看详情

《多模态大模型应用解决方案:基于Hugging Face、 ChatGPT、 GPT-4V和DALL-E 3等Transformer架构的自然语言处理与计算机视觉(第3版)》深入探讨大语言模型(LLM)的架构、应用,以及用于自然语言处理(NLP)和计算机视觉(CV)的各类平台,包括Hugging Face、OpenAI和Google Vertex AI。 本书呈现不同的Transformer架构,循序渐进地讲解前沿的基础模型与生成式AI,讲述LLM的预训练与微调方法,并实践各类应用场景,如生成文本摘要,乃至基于嵌入搜索技术实现问答系统。 本书分析LLM的潜在风险(包括幻觉、记忆泄露及隐私问题等),探讨如何使用具备规则库和知识库的审核模型来降低风险。从中可得到一个思路:通过将RAG(检索增强生成)与LLM结合,可提升模型的准确性,并更好地控制输出结果。 本书深入探索生成式视觉Transformer与多模态模型架构,并构建图像分类、视频转文本分类器等典型应用;此后讲述如何融合不同模型与平台,介绍使用AI智能体进行复制的技术。 通过本书的学习,读者能够深入理解Transformer 架构体系,熟练掌握预训练、微调技术,并明晰LLM的应用场景与行业上佳实践。 主要内容: ?对LLM进行预训练和微调。 ?使用多个平台,如Hugging Face、OpenAI和Google Vertex AI。 ?了解不同的分词器,以及预处理语言数据的**实践。 ?实现RAG和规则库,以应对幻觉问题。 ?使用BertViz、LIME和SHAP可视化Transformer模型的运行过程。 ?创建并实现跨平台链式模型,如HuggingGPT。 ?深入学习视觉Transformer相关内容,包括CLIP、DALL-E 2、DALL-E 3和GPT-4V。

丹尼斯·罗斯曼(Denis Rothman)毕业于索邦大学(Sorbonne University)和巴黎狄德罗大学(Paris Diderot University),主导设计了最早的专利编码和嵌入系统之一。他曾获得专利认证,成为研发AI认知机器人与聊天机器人的先行者。丹尼斯的职业生涯始于为法国酩悦香槟(Mo t et Chandon)开发自然语言处理聊天机器人系统,以及担任空中客车公司的AI战术防御优化方案架构师。而后,丹尼斯在IBM负责为多家**品公司开发AI资源优化系统,这项成果最终演化为全球广泛应用的APS(Advanced Planning and Scheduling,先进计划与调度)解决方案。

行业名家力荐 本书是一本兼具理论深度与工程落地价值的佳作。全书从Transformer核心架构讲起,循序渐进地覆盖BERT微调、预训练实战、ChatGPT/GPT-4生态应用,再延伸至ViT、CLIP、DALL-E 3与Stable Diffusion等视觉生成技术,完整串联自然语言处理与计算机视觉两大领域。书中搭配大量基于Hugging Face的可复现代码,将复杂的多模态技术拆解为清晰的实操步骤,既能帮助开发者夯实Transformer底层原理,也能为工业级多模态项目提供可落地的方案参考,是多模态技术从业者不可多得的案头读物。 杨欢|零一万物 多模态技术负责人 本书体系完整,兼顾技术原理与商业落地,非常适合AI创业团队与架构师参考。全书以Transformer架构为根基,既详解BERT、RoBERTa、GPT系列模型的微调与预训练方法,也深度拆解GPT-4V、DALL-E 3、Stable Diffusion等主流多模态工具的应用方案。书中配套的Hugging Face实战项目覆盖文本、图像、视频多场景,能帮助技术团队快速将大模型能力转化为产品功能,大幅降低多模态技术落地门槛,是一本拿来即用的工程实战手册。 苏洋|灵心巧手 联合创始人 兼首席AI架构师 面向企业级大模型应用落地,本书提供了体系化的技术路径。全书从Transformer基础理论出发,完整覆盖NLP下游任务、模型微调、嵌入与RAG方案,再延伸至多模态视觉生成与模型风险管理,逻辑清晰、层层递进。书中既有对主流模型架构的深度解析,也包含大量基于Hugging Face与OpenAI API的...

目录
荐语
查看详情 查看详情
目 录

第Ⅰ篇 Transformer基础

第1章 Transformer简介  /  002

1.1 基础模型  /  003

1.2 Transformer简史  /  008

1.3 AI从业者的职能转型  /  012

1.3.1 AI从业者的前景  /  013

1.3.2 资源选用  /  013

1.4 Transformer API的崛起  /  014

1.4.1 选择即用型API驱动库  /  016

1.4.2 选择合适的云平台和Transformer模型  /  017

1.5 小结  /  017

1.6 问题  /  018

1.7 参考文献  /  018

1.8 拓展阅读  /  019

第2章 Transformer模型架构入门  /  020

2.1 开启新纪元的Transformer:注意力就是一切  /  021

2.1.1 编码器堆叠  /  022

2.1.2 解码器堆叠  /  039

2.2 训练和性能  /  041

2.3 Hugging Face的Transformer模型  /  042

2.4 小结  /  042

2.5 问题  /  043

2.6 参考文献  /  043

2.7 拓展阅读  /  044

第3章 智能涌现与下游任务  /  045

3.1 范式迁移:NLP任务简介  /  046

3.1.1 解析Transformer子层注意力头  /  046

3.1.2 使用ChatGPT探究涌现现象  /  049

3.2 探究下游任务  /  ... 查看详情

《多模态大模型应用解决方案:基于Hugging Face、 ChatGPT、 GPT-4V和DALL-E 3等Transformer架构的自然语言处理与计算机视觉》第3版的新增内容凸显两大趋势。 (1) 多模态融合的深化:GPT-4V与DALL-E 3的集成标志着文本与图像的语义协同进入新阶段,书中通过视觉Transformer(ViT)、CLIP等模型详解了这一融合的技术本质。 (2) 生成式AI的产业化挑战:新增的“大模型风险”内容直面幻觉、安全、伦理等现实问题,并结合RAG、RLHF等技术提出解决方案,体现了对技术与社会责任的并重。 在人工智能技术的发展日新月异的今天,译者坚信,这本凝聚了理论深度与实践温度的著作,将成为连接国内外多模态技术创新的重要桥梁。本书不仅能帮助技术从业者快速掌握Transformer架构的核心原理与实操技能,更能为企业决策者提供产业落地的清晰路径。愿每一位读者都能通过本书,在多模态大模型的浪潮中把握机遇,将技术创新转化为实实在在的价值。

查看详情