图书前言

前言

相较于传统单模态机器学习,多模态机器学习旨在整合多种感官或模态信息(如文本、语音、图像等),从而产生更丰富的信息表示,对信息进行更准确的处理。因此,本学科涉及的知识点和方法论较多,应用场景广泛,综合性较强。初学者往往集中精力学习理论知识后小有领悟,但与实际应用场景结合时却一头雾水,不知从何下手。

本书编者常年从事多模态机器学习方向的相关研究和课程教学,同时也主持或参与了多项与多模态机器学习相关的国家级科研项目,对该领域的主要应用、算法模型和发展趋势有深刻的理解和独到的见解。同时,编者深知初学者在学习过程中可能遇到的困惑与难点。

因此,本书无论在整体编排还是在具体内容方面都力求理论与应用相结合的讲解方式,以实际问题为出发点,引出多模态机器学习的相关理论知识,再介绍具体算法模型以解决实际问题。本书旨在培养读者将实际问题转化为多模态机器学习问题的能力,发展系统化思维,并激发对算法模型的深入思考,使多模态机器学习不仅作为一个学术概念,而且作为一种解决问题的工具,更好地服务于现实生活。

本书主要内容如下。

第1章概述多模态机器学习的基础知识、发展历程和应用场景。后续章节分为理论知识篇和实际应用篇。

理论知识篇包括第2~7章,主要阐述文本、语音、图像和视频单模态特征提取方法,以及多模态表示学习和融合方法。

实际应用篇包括第8~14章,主要介绍多模态机器学习的实际应用场景,包括多模态讽刺检测、多模态人类行为识别、图像文本检索、组合式图像检索、跨模态视频时序片段定位、多模态摘要生成和多模态对话系统等。

多模态机器学习发展迅速,且编者自认为才疏学浅,更兼时间和精力所限,书中不妥和错漏之处在所难免,恳请读者批评指正。

编者2026年2月