图书目录

目录

第1章绪论1

1.1引言1

1.2基本术语1

1.3主要研究内容3

1.3.1多模态表示学习3

1.3.2多模态生成4

1.3.3多模态对齐6

1.4发展历程7

1.5学习任务8

1.6实际应用9

理论知识篇

第2章文本特征提取15

2.1传统文本特征提取15

2.1.1基于向量空间模型的方法15

2.1.2基于主题模型的方法17

2.2基于神经网络的文本特征提取20

2.2.1基于静态词向量的方法20

2.2.2基于动态词向量的方法26

第3章语音特征31

3.1数据采集31

3.1.1声波的特性32

3.1.2声音的采样和量化32

3.2预处理33

3.2.1预加重33

3.2.2分帧34

3.2.3加窗35

3.3手工特征提取36

3.3.1时域分析36

3.3.2频域分析39

3.3.3倒谱域分析41

3.3.4线性预测分析44

3.4基于神经网络的特征提取46

3.4.1基于基础神经网络的语音特征提取46

3.4.2基于预训练模型的语音特征提取51

第4章图像特征56

4.1图像特征相关的基本概念56

4.1.1图像存储格式56

4.1.2图像特征57

4.2手工特征提取58

4.2.1局部特征58

4.2.2全局特征66

4.3基于神经网络的特征提取71

4.3.1卷积神经网络72

4.3.2基于卷积神经网络的图像特征提取73

4.3.3其他图像特征提取方法83

第5章视频特征88

5.1手工特征提取88

5.1.1时空兴趣点89

5.1.2改进的密集轨迹特征90

5.1.3三维尺度不变特征变换93

5.1.4三维方向梯度直方图95

5.1.5立方体97

5.2基于神经网络的特征提取99

5.2.1双流网络99

5.2.2深度三维卷积网络100

5.3基于预训练模型的特征提取103

5.3.1预训练视频特征提取103

5.3.2基于提示学习的视频特征提取105

5.4其他模态106

第6章多模态表示学习108

6.1联合表示108

6.1.1神经网络109

6.1.2概率图模型110

6.1.3序列模型111

6.2协同表示112

6.2.1基于相似性的模型113

6.2.2结构化协同空间模型114

第7章多模态融合116

7.1多模态融合的层次116

7.1.1特征层融合116

7.1.2决策层融合117

7.1.3混合层融合117

7.2多模态融合的方法118

7.2.1基于规则的融合方法118

7.2.2基于分类器的融合方法120

7.2.3基于估计的融合方法122

7.3与多模态融合相关的其他问题123

7.3.1模态相关性123

7.3.2模态同步性125

7.3.3模态冗余性126

实际应用篇

第8章多模态讽刺检测129

8.1多模态讽刺检测数据集130

8.2多模态讽刺检测相关方法131

8.2.1基于注意力机制的多模态讽刺检测模型131

8.2.2基于图网络的多模态讽刺检测模型135

第9章多模态人类行为识别142

9.1多模态人类行为识别数据集142

9.2基于融合学习的多模态HAR143

9.2.1RGB与深度模态融合143

9.2.2RGB与骨架模态融合144

9.2.3骨架与深度模态融合145

9.2.4RGB与音频模态融合146

9.2.5RGB、深度和惯性传感器融合147

9.2.6其他融合方法148

9.3基于协同学习的多模态HAR148

9.4多模态HAR讨论151

第10章图像文本检索153

10.1图像文本检索数据集 154

10.2全局图像文本检索方法155

10.2.1基于嵌入架构的全局图像文本检索方法155

10.2.2基于交互架构的全局图像文本检索方法156

10.3局部图像文本检索方法158

10.3.1基于模态内关系建模的局部图像文本检索方法159

10.3.2基于模态间关系建模的局部图像文本检索方法164

10.3.3基于混合模态交互关系建模的局部图像文本检索方法166

10.4基于外部知识的图像文本检索方法168

10.5基于度量学习的图像文本检索方法171

10.6图像文本多模态预训练模型172

10.7相关研究任务173

10.7.1弱监督跨模态检索173

10.7.2零样本跨模态检索174

10.7.3场景文本感知的跨模态检索174

10.7.4跨语言图像检索174

第11章组合式图像检索175

11.1组合式图像检索数据集176

11.2组合式图像检索相关工作177

11.2.1基于属性的组合式图像检索177

11.2.2基于自然语言的组合式图像检索179

11.2.3其他工作186

第12章跨模态视频时序片段定位187

12.1跨模态视频时序片段定位数据集188

12.2有监督跨模态视频时序片段定位方法189

12.2.1两阶段的有监督跨模态视频时序片段定位方法189

12.2.2单阶段的有监督跨模态视频时序片段定位方法194

12.2.3基于强化学习的有监督跨模态视频时序片段定位方法197

12.3弱监督跨模态视频时序片段定位方法198

12.3.1两阶段的弱监督跨模态视频时序片段定位方法199

12.3.2单阶段的弱监督跨模态视频时序片段定位方法200

12.3.3基于强化学习的弱监督跨模态视频时序片段定位方法201

12.4无监督跨模态视频时序定位方法201

第13章多模态摘要生成203

13.1多模态摘要生成数据集204

13.2多模态摘要生成相关工作205

13.2.1抽取式摘要生成206

13.2.2生成式摘要生成208

第14章多模态对话系统214

14.1多模态对话系统数据集215

14.2多模态对话系统相关工作216

14.2.1基于序列模型的多模态对话系统216

14.2.2基于图模型的多模态对话系统220

14.2.3基于Transformer模型的多模态对话系统223