内容简介

数字经济飞速发展,“数据”是驱动行业创新、企业决策与社会进步的核心战略资源,被誉为“未来的石油”。海量数据的价值挖掘需要高效的采集、预处理等技术,这是大数据人才的核心能力,行业创新与企业决策也依赖高质量的数据采集与预处理等技术,因此相关技术的系统学习与实践尤为重要。通过《案例驱动式数据采集与预处理》即可开展数据采集、预处理、分析与可视化相关技术的系统学习。

本书共9章,内容包括概述、静态网页爬取、动态网页爬取、提升网络爬虫效率、Scrapy框架初探、Scrapy框架深入、系统日志数据采集、ETL工具Kettle、数据分析与可视化。本书构建了从数据基础概念到高级应用的完整知识体系,系统讲解Python数据采集与处理全流程技术,助力读者快速掌握数据采集、预处理、存储、分析及可视化的核心技术与实战技巧。

本书沿着“案例+知识”这一主线,以问题为导向,采用任务驱动的模式推进。除第1章概述外,每章通过案例贯穿,将案例设计为多个迭代版本,每个版本解决一两个问题,以提出问题、学习知识、解决问题为主脉络。读者在学习本书时,沿着清晰的案例路径,即可将理论与实践相结合,快速掌握相关技能。每章具有较完整的知识体系和真实的项目案例,章节中的“练一练”和“课后习题”可以帮助读者及时巩固所学知识,拓展知识的深度与广度。

本书覆盖了数据采集领域的常见数据源,如互联网数据、日志文件、企业业务系统数据等,适合作为大数据、人工智能、计算机、软件工程等相关专业的教材,也可作为数据采集与处理领域从业人员的实战参考用书。