《多模态大模型应用解决方案:基于Hugging Face、 ChatGPT、 GPT-4V和DALL-E 3等Transformer架构的自然语言处理与计算机视觉(第3版)》深入探讨大语言模型(LLM)的架构、应用,以及用于自然语言处理(NLP)和计算机视觉(CV)的各类平台,包括Hugging Face、OpenAI和Google Vertex AI。
本书呈现不同的Transformer架构,循序渐进地讲解前沿的基础模型与生成式AI,讲述LLM的预训练与微调方法,并实践各类应用场景,如生成文本摘要,乃至基于嵌入搜索技术实现问答系统。
本书分析LLM的潜在风险(包括幻觉、记忆泄露及隐私问题等),探讨如何使用具备规则库和知识库的审核模型来降低风险。从中可得到一个思路:通过将RAG(检索增强生成)与LLM结合,可提升模型的准确性,并更好地控制输出结果。
本书深入探索生成式视觉Transformer与多模态模型架构,并构建图像分类、视频转文本分类器等典型应用;此后讲述如何融合不同模型与平台,介绍使用AI智能体进行复制的技术。
通过本书的学习,读者能够深入理解Transformer 架构体系,熟练掌握预训练、微调技术,并明晰LLM的应用场景与行业上佳实践。
主要内容:
?对LLM进行预训练和微调。
?使用多个平台,如Hugging Face、OpenAI和Google Vertex AI。
?了解不同的分词器,以及预处理语言数据的**实践。
?实现RAG和规则库,以应对幻觉问题。
?使用BertViz、LIME和SHAP可视化Transformer模型的运行过程。
?创建并实现跨平台链式模型,如HuggingGPT。
?深入学习视觉Transformer相关内容,包括CLIP、DALL-E 2、DALL-E 3和GPT-4V。
