


定价:79.8元
印次:1-1
ISBN:9787302719830
出版日期:2026.08.01
印刷日期:2026.08.20
图书责编:刘金喜
图书分类:教材
数字经济飞速发展,“数据”是驱动行业创新、企业决策与社会进步的核心战略资源,被誉为“未来的石油”。海量数据的价值挖掘需要高效的采集、预处理等技术,这是大数据人才的核心能力,行业创新与企业决策也依赖高质量的数据采集与预处理等技术,因此相关技术的系统学习与实践尤为重要。通过《案例驱动式数据采集与预处理》即可开展数据采集、预处理、分析与可视化相关技术的系统学习。 本书共9章,内容包括概述、静态网页爬取、动态网页爬取、提升网络爬虫效率、Scrapy框架初探、Scrapy框架深入、系统日志数据采集、ETL工具Kettle、数据分析与可视化。本书构建了从数据基础概念到高级应用的完整知识体系,系统讲解Python数据采集与处理全流程技术,助力读者快速掌握数据采集、预处理、存储、分析及可视化的核心技术与实战技巧。 本书沿着“案例+知识”这一主线,以问题为导向,采用任务驱动的模式推进。除第1章概述外,每章通过案例贯穿,将案例设计为多个迭代版本,每个版本解决一两个问题,以提出问题、学习知识、解决问题为主脉络。读者在学习本书时,沿着清晰的案例路径,即可将理论与实践相结合,快速掌握相关技能。每章具有较完整的知识体系和真实的项目案例,章节中的“练一练”和“课后习题”可以帮助读者及时巩固所学知识,拓展知识的深度与广度。 本书覆盖了数据采集领域的常见数据源,如互联网数据、日志文件、企业业务系统数据等,适合作为大数据、人工智能、计算机、软件工程等相关专业的教材,也可作为数据采集与处理领域从业人员的实战参考用书。
前 言 在数字经济飞速发展的今天,“数据”已成为驱动行业创新、企业决策和社会进步的核心战略资源,被誉为“未来的石油”。然而,海量数据的价值挖掘离不开高效的采集、清洗、处理、分析与可视化技术,这也成为当前大数据领域人才亟须掌握的核心能力。为帮助读者系统掌握数据采集与处理的全流程技术,我们结合多年教学经验与工程实践,编写了这本案例驱动式教材。 《案例驱动式数据采集与预处理》是特色应用型课程“数据采集与预处理”的配套教材,以Python为核心编程语言,遵循“学以致用”理念,继承了课程建设团队此前出版的湖北省一流本科课程配套教材《案例驱动式Python基础与应用》的设计思路:以实际案例为主线、以问题为导向、以任务驱动模式推进。除第1章概述外,其余各章均以一个真实项目案例贯穿,每个案例设计2~4个层层递进的迭代版本,每个版本聚焦解决一两个核心问题,形成“提出问题—引出所需知识点—学习知识—运用知识解决问题”的完整闭环,让读者在实践中理解技术原理、掌握实战技能。 本书共9章,构建了从数据基础概念到高级应用的完整知识体系,系统讲解Python数据采集与处理全流程技术,助力读者快速掌握数据采集、预处理、存储、分析及可视化的核心技术与实战技巧。 第1章为概述,介绍数据与大数据的基本概念、类型、组织形式、价值及处理流程,同时讲解Python IDLE与PyCharm的安装配置,为后续学习奠定基础。 第2章聚焦静态网页爬取,以“贝壳网房源信息爬取”为案例,详细讲解网络爬虫的概念、工作流程,以及使用requests、urllib库获取网页数据,通过BeautifulSoup、XPath解...
第1章 概述 1
1.1 数据 1
1.1.1 数据的概念 1
1.1.2 数据类型 2
1.1.3 数据组织形式 2
1.1.4 数据的价值 3
1.2 大数据 4
1.2.1 大数据采集 5
1.2.2 大数据来源 5
1.2.3 大数据采集方法 7
1.3 数据存储 8
1.4 数据预处理 9
1.5 数据分析 11
1.6 数据可视化 12
1.7 基础软件安装与运行 13
1.7.1 Python 3.9.9的安装与使用 14
1.7.2 PyCharm的安装与使用 16
第2章 网络数据采集——静态网页爬取 23
2.1 网络爬虫的概念 24
2.2 网络爬虫的工作流程 24
2.3 通过requests库获取网页数据 27
2.3.1 requests库简介 27
2.3.2 requests库的常用方法 28
2.4 通过urllib库获取网页数据 32
2.4.1 urllib库简介 33
2.4.2 urllib库的基本使用 33
2.5 通过BeautifulSoup解析网页 39
2.5.1 beautifulsoup4库简介 39
2.5.2 beautifulsoup4库的使用 40
2.6 通过XPath解析网页 51
2.6.1 XPath基本语法 52
2.6.2 XPath谓语表达式 54
2.6.3 XPath常用的功能函数 55
2.6.4 XPath的使用 55
2.7 数据存储 59
2.7.1 保存于CSV文件 59
2.7.2 保存于JSON文件... 查看详情
问题导向 资源丰富 案例驱动 实操精讲 由浅入深 产教融合 ?案例驱动,任务导向。全书以“案例+知识”为主线,通过真实项目贯穿,案例分层迭代,形成“提出问题一学习知识一代码解决”的完整闭环,实现理论与实战深度融合,适合零基础入门。 ?Python为主线,主流工具全覆盖。以Python为主线,覆盖数据处理主流工具,一站式讲解网页爬取、日志采集、业务系统数据库数据采集、大数据ETL、数据预处理、分析与可视化等内容。 ?教学与自学双适配,配套资源丰富。每章设置随堂练习与课后习题,便于巩固知识点,并配备了完善的教学资源供教师获取。
查看详情





