图书前言

前言

当前,人工智能技术正以前所未有的速度发展,大模型、生成式人工智能等新兴应用层出不穷,深刻改变着各行各业的技术范式与业务模式。在这一轮技术变革中,数据始终是驱动智能的核心燃料——无论是传统机器学习模型,还是大规模预训练模型,其能力上限都高度依赖于数据的质量与规模。如何高效地处理、分析和挖掘数据价值,已成为人工智能落地应用的关键环节。

Python以其简洁易学、生态丰富、社区活跃等优势,已成为数据分析领域的首选语言。NumPy、Pandas、Matplotlib、scikitlearn等成熟库构成了完整的数据分析工具链,使Python能够高效完成从数据获取、清洗、处理、可视化到建模的全流程。与此同时,数据分析并非仅仅是工具的使用,更是一套融合了业务理解、分析思维、统计方法和算法原理的综合能力。掌握Python数据分析技术及与之配套的方法论与核心思维,已成为数据科学、商业分析、人工智能等相关领域人才的必备技能。

本书主要内容

本书可视为一本以实践为导向、理论结合实践的书籍,非常适合具备一定Python编程基础、希望系统掌握数据分析核心方法与完整流程的高等院校学生及相关领域从业人员学习。读者可以在短时间内学习数据分析从环境搭建、基础操作到建模应用的核心知识与分析方法,逐步建立起完整的数据分析思维体系。

全书共分为五部分,共计13章。各部分内容如下。

第1部分: 数据分析准备(第1、2章)。

第1章: 数据分析入门,涵盖数据分析的价值、应用、核心思维、OSEMN模型与分析流程,以及Anaconda与Jupyter Notebook的环境搭建与核心操作,并通过超市运营数据分析方案设计进行实践演练。第2章: Python数据分析必备编程基础,讲解Python基本语法、数据类型、运算、流程控制、函数及容器类型,并深入介绍NumPy库的数组创建、属性、索引、形状操作、向量化运算与广播机制,最后通过电商销售数据分析项目巩固所学。

第2部分: 数据处理与可视化分析(第3~5章)。

第3章: Pandas数据处理基础,介绍Series与DataFrame数据结构、索引操作、数据查询与编辑、描述性统计、分级别汇总统计、数据排序及文件读写,并通过电商运营数据初探项目进行实践。第4章: 数据清洗与预处理,详细阐述重复值、缺失值、异常值的检测与处理方法,以及数据类型转换、归一化、标准化与连续数据分箱等转换技术,结合电商订单数据清洗项目加深理解。第5章: 数据可视化分析,从可视化简介入手,系统学习Matplotlib基础绘图流程、图形属性配置及常用图表(折线图、柱状图、散点图、饼图、箱线图、热力图)的绘制,最后通过人力资源数据可视化分析项目提升分析表达能力。

第3部分: 数据整合与探索性分析(第6~9章)。

第6章: 数据合并与重塑,讲解纵向合并(concat)、横向合并(concat、merge、join)以及数据变形(melt、pivot、stack/unstack)操作,通过中风患者健康数据整合项目加以应用。第7章: 分组聚合与数据透视,深入分组思想,掌握groupby分组、agg聚合、apply与transform进阶聚合、pivot_table透视表及crosstab交叉表的使用,并在城市空气质量数据分析项目中实践。第8章: 时间序列分析,涵盖时间类型转换、时间索引、时间信息提取、间隔运算、规律时间序列创建、重采样、趋势分解与移动平均法,结合产品日销量季节性分析项目巩固。第9章: 探索性数据分析,介绍单变量分布分析、双变量关系分析及多变量探索方法(相关性矩阵、散点矩阵、降维观察、分组对比),并通过广告效果与心脏病患病数据两个EDA项目锻炼综合分析能力。

第4部分: 预测建模与机器学习(第10、11章)。

第10章: 机器学习之有监督学习,概述机器学习与scikitlearn库,讲解特征工程、有监督学习(回归与分类)及常用评估指标,并通过房价估计与用户流失预警两个项目分别演练回归与分类任务。第11章: 机器学习之无监督学习,介绍聚类分析、KMeans算法,配合游客评论聚类和购物篮分析项目加深理解。

第5部分: 综合实践(第12、13章)。

第12章: 电商用户行为分析与精准营销,以真实电商数据为基础,涵盖RFM指标计算、用户分群、特征构建与业务解读等全流程分析。第13章: 混凝土配方优化与成本决策,聚焦工业生产场景,综合运用数据探索、特征工程、回归建模与成本优化方法,为配方设计提供数据驱动的决策支持。

本书特色

(1) 系统全面,结构清晰。

全书遵循数据分析标准流程,分为数据分析准备、数据处理与可视化分析、数据整合与探索性分析、预测建模与机器学习、综合实践五部分,层层递进,帮助读者构建完整知识体系。

(2) 知行合一,强化思维。

本书不仅讲解Python工具库的使用方法,更注重数据分析思维培养,将OSEMN模型、分组思想、探索性分析、业务解读等方法论贯穿始终,引导读者从“会用工具”走向“会做分析”。

(3) 案例驱动,实践导向。

每章均设置针对性实践项目,前11章涵盖超市运营、电商销售、学生压力、空气质量等丰富场景,最后两章为综合项目——电商用户行为分析与精准营销、混凝土配方优化与成本决策,让读者在解决真实问题中巩固所学。

(4) 深浅适度,便于教学。

内容编排兼顾基础与进阶,重点突出、难点详解,代码示例简洁规范,图表清晰直观,既适合课堂教学,也方便读者自学,帮助读者在有限时间内掌握数据分析核心技能。

配套资源

为便于教与学,本书配有微课视频、源代码、数据集、教学课件、教学大纲、教案、教学进度表、习题题库、期末试卷及答案。

(1) 获取微课视频方式: 先刮开本书封底的文泉云盘防盗码并用手机版微信App扫描,授权后再扫描书中相应的视频二维码,观看教学视频。

(2) 获取源代码和数据集方式: 先刮开本书封底的文泉云盘防盗码并用手机版微信App扫描,授权后再扫描下方二维码,即可获取。

源代码和数据集

彩色图片

(3) 其他配套资源可以扫描本书封底的“书圈”二维码,关注后回复本书书号,即可下载。

读者对象

本书主要面向全国高等学校的在读学生,以及从事数据分析、数据科学、机器学习等领域的广大教师、科研人员和从业人员。

在编写本书的过程中,编者参考了诸多相关资料,在此对相关资料的作者表示衷心的感谢。由于作者水平有限且时间仓促,书中难免存在疏漏之处,欢迎广大读者批评指正。

编者2026年5月