图书目录

CONTENTS

目录

第 1章绪论 1 

1.1概述 1 

1.2理论基础 1 

1.2.1卷积神经网络 1 

1.2.2池化 4 

1.2.3注意力机制 5 

1.2.4 Transformer网络 8 

1.3技术难点与挑战 9 

1.3.1输入处理 10 

1.3.2信息融合 11 

1.3.3其他问题与挑战 11 

1.4典型应用 12 

1.4.1图像描述 12 

1.4.2文图生成 13 

1.4.3视觉问答 17 

1.4.4视觉推理 19 

1.5伦理与社会影响 21 

1.5.1隐私与数据安全挑战 21 

1.5.2社会公平与道德考量 22 

1.5.3社会影响与接受度 23

第 2章多模态表示学习 24 

2.1理论基础 24 

2.1.1关于表示学习 24 

2.1.2多模态表示学习 26 

2.1.3不同模态的表示映射 27 

2.2基本框架 28 

2.2.1联合表示框架 28 

多模态智能信息处理 

2.2.2协同表示框架 30 

2.2.3编码器-解码器框架 34 

2.3经典模型 36 

2.3.1概率图模型 36 

2.3.2多模态自动编码器 37 

2.3.3典型相关分析 39 

2.4多模态大规模预训练 41 

2.4.1 CLIP的横空出世 41 

2.4.2基于 CLIP的改进方法 43 

2.4.3其他多模态预训练方法 45 

2.5多模态大语言模型 48 

2.5.1模型简介 48 

2.5.2模型架构 50 

2.5.3训练流程 53 

2.5.4新技术的涌现 53

第 3章多模态信息融合 56 

3.1基于规则的融合 56 

3.1.1线性加权融合 57 

3.1.2多数投票融合 58 

3.2基于滤波的融合 59 

3.2.1卡尔曼滤波 59 

3.2.2粒子滤波 61 

3.3基于分类的融合 62 

3.3.1支持向量机 62 

3.3.2 Dempster–Shafer理论 64 

3.3.3贝叶斯推断 66 

3.3.4动态贝叶斯网络 67 

3.3.5最大熵模型 68 

3.4深度融合 69 

3.4.1深度置信网络 69 

3.4.2递归神经网络 70 

3.4.3编码器-解码器网络 72 

目录 

3.4.4 Transformer网络 74 

3.4.5图神经网络 76

第 4章多模态信息检索 80 

4.1基于树的最近邻检索 80 

4.1.1 K维树 80 

4.1.2 Ball-树 81 

4.1.3 K-means层次树 82 

4.1.4 Annoy检索算法 82 

4.2基于图的最近邻检索 83 

4.2.1 K-Graph 83 

4.2.2 NSW图 84 

4.2.3 HNSW图 84 

4.3基于量化的近似最近邻检索 86 

4.3.1乘积量化 86 

4.3.2加性量化 89 

4.3.3复合量化 90 

4.4基于哈希的近似最近邻检索 92 

4.4.1基于传统模型的哈希学习框架 93 

4.4.2基于类别特定中心的双流哈希 94 

4.4.3基于成对约束的跨模态哈希 98 

4.4.4基于语义结构的无监督哈希 100 

4.4.5基于渐近演化的深度哈希 104 

4.4.6汉明空间检索中的对抗样本 108

第 5章多模态内容理解 113 

5.1图像描述任务 114 

5.1.1序列生成网络 115 

5.1.2序列化描述生成 117 

5.1.3基于注意力的生成 119 

5.2视觉问题 124 

5.2.1基于多模态融合的问答 126 

5.2.2基于注意力机制的问答 129 

5.2.3基于组合推理的问答 134 

多模态智能信息处理 

5.3场景图生成 138 

5.3.1融合上下文信息的生成 140 

5.3.2融入先验知识的生成 146 

5.4基于多模态预训练模型的内容理解 151 

5.4.1图像-文本预训练模型 152 

5.4.2视频-文本预训练模型 152 

5.5未来发展方向 153

第 6章多模态内容生成 154 

6.1图像内容生成 155 

6.1.1基础理论 155 

6.1.2文图生成 162 

6.1.3基于手绘草图的图像内容生成 165 

6.1.4图像风格迁移 169 

6.2文本内容生成 172 

6.2.1文本内容生成的理论基础 172 

6.2.2图像描述生成 177 

6.2.3视频摘要生成 178 

6.3视频内容生成 179 

6.3.1无条件视频生成 180 

6.3.2文本到视频生成 182 

6.3.3视频到视频生成 184 

6.3.4其他条件到视频生成 184

第 7章多模态脑机智能与应用 187 

7.1脑机接口技术的背景和现状 187 

7.1.1技术背景 188 

7.1.2发展现状 190 

7.2脑信号采集与表示 194 

7.2.1非侵入式脑信号采集与表示 194 

7.2.2侵入式脑信号采集与表示 196 

7.3多模态脑机智能的应用 200 

7.3.1医学领域的应用 200 

7.3.2非医学领域的应用 203 

目录 

7.4基于脑信号的视觉内容重建 209 

7.4.1人脑的 fMRI数据 210 

7.4.2自然场景数据集(NSD) 211 

7.4.3基于预训练大模型的重建方法 211 

7.4.4基于条件扩散模型的重建方法 213

第 8章发展趋势分析 215

参考文献 219