图书前言

前言

在当今数字化时代,数据已然成为推动社会进步与行业发展的关键驱动力。网络爬虫技术作为挖掘互联网海量数据宝库的有力工具,在大数据分析、人工智能、商业智能等众多前沿领域占据着不可或缺的重要地位。Python 语言凭借其简洁优雅的语法、强大的功能库以及活跃的社区支持,在网络爬虫开发领域备受青睐,成为众多开发者的首选。本书旨在为读者提供全面且深入的Python爬虫与网络数据采集知识,助力读者掌握数据采集实用技能,适应时代发展需求。

本书主要内容

全书力求内容精练、系统,由浅入深,循序渐进。本书提供综合案例、拓展案例的思路分析和代码,力争将知识讲解、能力培养、素质教育融为一体。

本书全面系统地讲解 Python 爬虫与网络数据采集技术,全书共有9章。

第1章爬虫与网络数据采集概述,包括认识数据采集、走近网络爬虫、网络数据采集的工作原理与流程、网络数据采集的实现技术、网络数据采集的合法性、Python爬虫环境搭建、综合案例——采集“小说”类图书信息。

第2章网络爬虫基础知识,包括浏览器加载网页的过程、网页基础知识、HTTP基础知识、Google开发者工具、综合案例——采集2024年中国大学排名。

第3章爬虫流程与Requests库的使用,包括Python爬虫基本流程、Requests库的使用、综合案例——采集排行榜电影信息、拓展案例——采集翻译信息。

第4章网页数据解析与提取,包括Beautiful Soup的使用、正则表达式的使用、lxml库与XPath的使用、拓展案例——采集二手车信息。

第5章爬虫数据的存储,包括爬虫数据的存储方式、存储至JSON文件、存储至MongoDB数据库、存储至MySQL数据库、拓展案例——采集贴吧信息。

第6章动态网页数据采集,包括静态网页与动态网页的区分、使用逆向分析法采集动态网页、使用Selenium采集动态网页、拓展案例——采集非物质文化遗产信息。

第7章反爬策略与反反爬技巧,包括反爬虫与反反爬虫的定义、反爬虫技术、反反爬虫技术、拓展案例——采集招聘网岗位信息。

第8章Scrapy爬虫框架的应用,包括Scrapy框架概述、Scrapy的工作原理、综合案例——采集古诗词排行榜、拓展案例——采集微博搜索文章信息。

第9章实践案例——多类型数据采集与存储,包括采集股票财经信息、采集聚合数据官网的天气数据、采集安居客租房信息。

本书特色

(1) 知识体系阶梯化,以案例强化实践能力。

本书构建“基础原理→技术工具→综合应用”的渐进式知识框架,通过阶梯式案例设计实现理实一体化教学,强化学生技术迁移能力和复杂问题解决能力。案例覆盖数据采集全流程,融入真实行业场景。拓展案例与行业工具深度融合,确保技能训练与产业需求无缝对接。

(2) 三维目标协同培养,技术能力与职业素养并重。

本书围绕知识、能力、素质目标,系统讲解Python爬虫技术,构建扎实的理论基础。通过工程化任务培养学生“采集需求→思路分析→代码实现”的全流程实践能力。在技术训练中融入数据伦理、创新思维和团队协作等职业素养教育,培养适应行业发展的应用型人才。

(3) 全流程资源支撑,教学与终身学习贯通。

本书构建“课内实训+课外拓展”双轨资源体系,基础技能模块配备详细代码与思路分析,高阶技术模块通过微视频降低学习门槛。知识图谱整合碎片化技术要点,配套综合案例与拓展案例形成技术闭环。数字化资源支持混合式教学,帮助学生突破技术边界。

配套资源

为便于教与学,本书配有微课视频、源代码、教学课件、教学大纲、教案、教学日历、实验指导书、题库、期末试卷及答案。

(1) 获取微课视频方式:  先刮开本书封底的文泉云盘防盗码并用手机版微信App扫描,获得授权后再扫描书中相应的视频二维码,观看视频。

(2) 获取源代码和案例素材方式:  先刮开本书封底的文泉云盘防盗码并用手机版微信App扫描,获得授权后再扫描下方二维码,即可获取。

源代码和案例素材

全书网址

(3) 获取其他配套资源方式: 扫描本书封底的“书圈”二维码,关注后回复本书书号,即可下载。

读者对象

本书可以作为高等学校数据科学与大数据技术、计算机科学与技术、软件工程等计算机相关专业的教材,以及网络爬虫技术爱好者、数据分析从业人员的自学用书。

全书由叶丽珠负责统稿和主审,第1章、第3章~第6章由叶丽珠编写,第2章、第7章~第9章由张兰编写。

本书在编写过程中得到广州商学院的项目支持,并参考了众多优秀作者的相关书籍,从中汲取了宝贵的知识与经验,同时网络资源为本书提供了丰富的案例与前沿信息,编者承蒙诸多帮助,在此向他们表示衷心的感谢。由于编者水平有限,书中难免存在不足之处,欢迎广大读者和专家批评指正。

编者

2026年1月