PREFACE
前言
人工智能( AI)正以前所未有的广度和深度深刻改变着人类社会生活,改变着世界。近年来,随着算法、数据和算力的协同发展,人工智能进入了快速突破与广泛应用并进的新阶段。2014年生成对抗网络的提出,标志着 AI生成内容( AIGC)时代的开启; 2017年诞生的 Transformer架构,已经成为大语言模型( LLM)的基础框架; 2023年被视为大语言模型元年,全球范围密集发布了上百个大模型,国内更是掀起“百模大战”。伴随技术突破,大语言模型从单模态向多模态甚至全模态持续扩展,推动人工智能从“理解单一信息”向“认知物理世界”的关键跨越。这一进程,已经成为通向通用人工智能( AGI)的必由之路。从概念的发展逻辑来看,多模态已不再局限于文本、音频、图像、视频等传统形态,逐步拓展至草图、激光雷达、脑电波等特定数据形式;从技术的底层逻辑来看,多模态智能信息处理的理论、方法和技术在现代人工智能的发展进程中始终发挥着重要作用——这也正是本书以“多模态智能信息处理”为题目的初衷。
本书章节的组织遵循两条脉络——模态扩展和技术演进。全书共分为 8章。第 1章绪论,主要介绍多模态智能信息处理的基本概念、理论基础、技术难点、典型应用,以及伦理与社会影响,为后续内容奠定整体认知框架。第 2章围绕多模态表示学习,系统介绍多模态表示的基本思想、典型框架、经典模型,以及多模态大规模预训练和多模态大语言模型的相关内容。第 3章聚焦多模态信息融合,介绍基于传统的和深度学习的融合方法,帮助读者理解不同模态之间的信息协同机制。第 4章探讨多模态信息检索,重点介绍近似最近邻检索及跨模态哈希等关键技术。第 5章围绕多模态内容理解,包括图像描述生成、视觉问答、场景图生成,以及基于多模态预训练模型的内容理解方法。第 6章介绍多模态内容生成,涵盖图像生成、文本生成和视频生成等新兴任务。第 7章面向交叉前沿领域,介绍多模态脑机智能与应用,重点讨论脑信号采集与表示、脑机接口应用以及基于脑信号的视觉内容重建。第 8章对多模态智能信息处理的发展趋势进行分析与展望,以期为读者后续学习和研究提供启发。
本书由邓成教授策划、组织和统稿,杨二昆副教授、杨旭副教授、闫杰熹副教授、魏坤副教授和武阿明副教授等参与了相关章节的研究与撰写工作。各位作者长期从事人工智能、多模态信息处理及相关交叉领域研究,在理论探索、方法创新和应
多模态智能信息处理
用实践方面积累了丰富的经验。本书的问世凝聚了 OPTIC实验室师生的共同努力,也得益于科学研究的长期积累,恕不一一具名,但感念在心。
本书兼顾统一性和综合性,尝试以系统的思维和浅显的文字帮助读者理解多模态智能信息处理领域的知识演进与技术发展的内在逻辑。本书适合作为人工智能、计算机科学与技术、数据科学等相关专业本科生和研究生的教材或参考书,也可供从事人工智能研究、技术开发与行业应用的科研人员和工程技术人员阅读参考。
书稿虽成,力有不逮,疏漏差错,恐在所难免。欢迎广大读者将您的建议发送至: multimodal.xd@xidian.edu.cn,我们会闻过而喜,以期内容日新又新。
