图书前言

近年来,依托大数据与先进算法的持续迭代,人工智能领域取得了长足进步。尤其是生成式人工智能的快速发展,已成为驱动科技创新的关键力量,深刻改变着人们的生产生活与工作方式。在此背景下,人工智能时代的数据管理类专业也面临着前所未有的发展挑战。人工智能得以发挥作用的重要前提与核心在于学习的来源(数据)与学习的能力。数据挖掘正是具备这种学习能力的数据科学方法。Python作为一种被人们广泛使用的编程语言,以其简洁明了的语法和强大的库支持成为数据挖掘的首选工具。本书以Python为载体,深入浅出地介绍了数据挖掘的基本概念、核心方法和实际应用,帮助读者从理论到实践,逐步掌握数据挖掘的精髓。

 本书内容

本书内容全面、结构清晰,共分为6章。第1章详细介绍数据挖掘的准备工作,讲解数据挖掘的含义、步骤与任务,加强对数据类型、属性类型等基础知识的认知,并实现具体的数据处理任务,为后续数据挖掘任务的实施奠定坚实的学习基础。数据挖掘的任务主要包括分类与回归、时间序列预测、关联规则挖掘、聚类、离群点检测等,在后续的5章中对每项数据挖掘任务进行深入探讨;第2章聚焦分类与回归,涵盖决策树及其集成方法(如随机森林、XGBoost)、回归方法(包括各类回归)、支持向量机、各类神经网络(如ANN、图神经网络等)以及贝叶斯模型(如朴素贝叶斯、贝叶斯信念网络);第3章专注于时间序列预测,主要包括一维时间序列预测方法与多维时间序列预测方法;第4章详细介绍关联规则挖掘的两类经典方法——Apriori算法和FPgrowth算法;第5章探讨聚类方法,包括KMeans系列、层次聚类、基于密度的聚类、神经网络聚类以及模糊聚类;第6章介绍离群点检测。

 本书特色

(1) 方法论导向,聚焦原理与实现。本书以理论方法为核心架构,每章均深入剖析一种数据挖掘方法的原理、机制与流程,对算法的核心思想与数学模型进行了清晰阐释,为后续的实践应用奠定坚实基础。

(2) 案例驱动教学,强调实战与应用。本书格外注重理论与实践的衔接。书中所有数据挖掘方法均配有完整的Python实现代码、详细的代码解读以及来自真实场景的实践案例。通过具体的实践操作,读者可以更好地掌握数据挖掘技术,并将其应用于现实场景中,从而提升自身的实战能力。

(3) 学科交叉融合,拓展视野与价值。本书突破了单一学科的局限,融汇了数据科学、统计学、机器学习与管理科学的核心知识,具有鲜明的多学科交叉创新特点,旨在讲授如何运用数据科学、统计学和机器学习的方法解决管理领域的实际问题。通过跨学科的视角,读者不仅能够掌握数据挖掘的技术细节,还能理解其在不同领域的应用价值和实际意义。

 配套资源

为便于教学,本书提供丰富的配套资源,包括教学大纲、教学课件、电子教案、程序源码、教学进度表、数据集、在线题库和微课视频。资源下载提示

课件等资源: 扫描封底的“图书资源”二维码,在公众号“书圈”下载。

素材(源码)等资源: 扫描目录上方的二维码下载。

在线自测题: 扫描封底的作业系统二维码,再扫描自测题二维码,可以在线做题及查看答案。

微课视频: 扫描封底的文泉云盘防盗码,再扫描书中相应章节的视频讲解二维码,可以在线学习。

本书由彭珍、李华姣、崔巍共同编写,在编写过程中得到了中国地质大学(北京)教务处(教师发展中心)、经济管理学院的大力支持,在此表示衷心的感谢,同时感谢协助完成本书部分实验案例与编辑工作的学生。

由于编者水平有限,书中难免存在不足之处,敬请广大同行和读者批评指正。

编者2026年3月