前言
自然语言处理是一门融计算机科学、语言学、人工智能于一体的科学,是计算机科学领域与人工智能领域的一个重要方向,被誉为“人工智能皇冠上的明珠”。
本书共10章,第1章介绍自然语言处理的基本概念; 第2章介绍数学基础,内容包含微积分、概率论、矩阵论、信息论、随机过程等; 第3章介绍模型基础,内容包含传统机器学习模型、深度学习模型和模型评价; 第4章介绍开发环境搭建; 第5章介绍语言模型,内容包含语言模型概述、N元语言模型和神经网络语言模型等; 第6章介绍词法分析,内容包含词性分析、中文分词、词义消歧等; 第7章介绍句法分析,内容包含短语句法分析、依存句法分析等; 第8章介绍语义分析,内容包含语义表示、词汇级语义分析和句子级语义分析等; 第9章介绍篇章分析,内容包含篇章分析理论概述、篇章结构分析、指代消解、篇章连贯性建模等; 第10章介绍虚假信息检测算法实践,内容包含具体的模型实现及代码精讲等。
本书第1、2、4、8、9章,以及附录由徐凡编写; 第3、5、6、7、10章由黄琪编写,全书由徐凡统稿。本书相关代码可以从清华大学出版社官网本书页面下载,也欢迎读者加入作者QQ群,共同探讨一些具体的细节。
本书主要作为普通高等院校人工智能专业“自然语言处理”课程教材,也可以作为计算机、计算语言学、电子信息、大数据、数据挖掘专业本科生教材,适合希望深入研究自然语言处理算法的计算机工程师阅读,也适合希望进入人工智能应用领域的研究者参考。
编者深知水平有限,书中难免有错误和不足之处,恳请同行和广大读者,特别是使用本书的教师和学生多提宝贵意见。
编者2025年9月
