前言
习近平总书记在党的二十大报告中深刻指出: 教育、科技、人才是全面建设社会主义现代化国家的基础性、战略性支撑。
这一论断明确了教育、科技、人才在国家发展中的核心地位。我们必须坚持科技是第一生产力、人才是第一资源、创新是第一动力,深入实施科教兴国战略、人才强国战略、创新驱动发展战略,共同服务于创新型国家的建设。
报告同时强调了推动战略性新兴产业融合集群发展的重要性,特别是在新一代信息技术、人工智能、生物技术、新能源、新材料、高端装备、绿色环保等领域构建新的增长引擎。
在这一宏观背景下,人工智能作为引领新一轮科技革命和产业变革的核心技术,其在制造、金融、教育、医疗和交通等领域的应用场景不断落地,极大地改变了既有的生产生活方式。
机器学习作为人工智能的核心和基础,其研究和应用对于培养具有创新能力的人才、推动科技进步和实现国家战略目标具有重要意义。
在编者之前的著作《机器学习入门基础(微课版)》(ISBN 9787302619581)中,重点阐述了机器学习的基本原理、算法及其数学基础。这本书已被100多所学校选为本科生教材,深受读者欢迎。然而,随着技术的不断发展和实践应用的增多,我意识到单纯的理论阐述已不能满足读者的需求。因此,编者决定撰写《机器学习与数据挖掘(基于Python)》,增加实践内容,帮助读者更好地将理论与实际相结合。
在本书中,编者结合丰富的案例分析和实际操作,基于Python开发环境,带领读者通过真实的数据集进行建模与评估,直观地理解各种机器学习算法的实际效果。通过理论与实践的深度融合,本书旨在培养读者的应用能力,使读者能够独立完成机器学习项目,解决现实生活中的问题。
本书共11章,主要内容如下。
第1章机器学习与数据挖掘概述。介绍了机器学习的定义、类型、主要概念,数据挖掘的概念与过程,以及两者之间的关系和应用领域。
第2章Python基础与常用库。回顾了Python的基础,包括Python简介、安装、数值类型、流程控制、函数与模块,以及NumPy、Pandas、Matplotlib、Seaborn和scikitlearn等常用库的介绍。
第3章数据准备与预处理。涉及数据收集、质量控制、数据清洗、缺失值处理、数据变换、规范化、特征工程和特征选择。
第4章回归算法。讨论了线性回归、岭回归、套索回归以及回归的评价指标,并提供了房价预测的案例。
第5章分类算法。包括逻辑回归、K最近邻算法(KNN)、朴素贝叶斯分类器、决策树、支持向量机等分类算法,以及分类的评价指标和垃圾邮件分类的案例。
第6章集成学习。介绍了集成学习的基本概念、Bagging与Boosting、Stacking与模型融合,以及XGBoost与LightGBM,并提供了金融欺诈检测的案例。
第7章聚类分析。讨论了聚类的基本概念、K均值聚类、DBSCAN与密度聚类、层次聚类、聚类算法的评价指标,以及客户聚类分析的案例。
第8章关联规则学习。涉及关联规则的基本概念、Apriori算法与FPGrowth算法,以及图书购买分析的案例。
第9章无监督学习与降维。讨论了主成分分析(PCA)、线性判别分析(LDA)、自编码器与tSNE,并提供了图像分类中的降维与特征提取的案例。
第10章时间序列分析。介绍了时间序列的特性、预处理、可视化、常用算法、性能评估,以及航空乘客数量预测的案例。
第11章机器学习项目综合实践。提供了问题定义、数据集选择、数据预处理、模型选择、性能评估、部署与监控的指导,并给出了机器学习项目报告的实践。
在教学过程中,教师可根据授课重点和学生基础,灵活调整教学顺序和内容深度,以实现最佳的教学效果。
黄海广2026年6月
