前言
随着信息技术的飞速发展,全球数据量呈现爆炸式增长,人类社会正步入一个数据驱动的新时代。大数据技术作为信息时代的重要引擎,正在深刻地改变着我们的生活、工作和思维方式,也成为推动社会进步和经济发展的重要力量。
近年来,我国高度重视大数据产业发展,相继出台一系列政策措施,推动大数据技术与各行业深度融合,赋能传统产业转型升级。在此背景下,培养具备扎实理论基础和较强实践能力的大数据人才,已成为高校计算机相关专业的重要任务。此外,大数据技术已经成为计算机相关专业的重要教学内容之一,大数据技术是一种实践性很强的技术,大数据实践教材需要根据最新的技术发展和应用趋势,选择前沿的项目和案例,帮助读者了解和掌握最新的技术知识和应用方法。然而,大数据技术涉及知识面广、技术更新迭代快,传统的教学模式难以满足学生的学习需求。为了更好地适应时代发展,培养符合社会需求的大数据人才,我们编写了这本教材,本书依托华为ECS、MRS大数据平台,针对18项大数据技术开展详细介绍,并在实验环境搭建、基本操作、编程实践等环节设计了多个典型应用实例,由浅入深地指导读者进行动手实践学习。读者通过参考本书提供的大数据处理和大数据分析实验,可以有效提高实践能力和应用水平。
本书结构:
本书共分为7篇,每篇对应一个主流大数据技术领域。
(1) Hadoop篇包含Hadoop、HDFS、Yarn、MapReduce和Hive 5章,系统地展示了利用Hadoop平台对批量离线数据进行分析的技术方法。
(2) Spark篇针对Spark RDD、Spark SQL的批量离线数据处理技术进行了介绍,提供了多个Spark Shell操作实践实例,并提供了Java程序实现实例。
(3) 流处理篇包含了目前主流流数据处理技术Spark Streaming和Flink,帮助读者充分了解流数据处理的窗口算子与底层架构。
(4) NoSQL数据库篇分别针对主流NoSQL数据库(包括列族数据库Hbase、键值数据库Redis、文档数据库MongoDB、时序数据库InfluxDB、图数据库Neo4j)的基本操作、高级语法以及编程应用进行了介绍,使读者可以轻松掌握NoSQL的实践应用。
(5) ETL工具篇以目前主流海量日志采集工具Flume为例,帮助读者快速掌握ETL工具的一般用法。
(6) 消息队列篇分别介绍了采用push方式的消息队列RabbitMQ,以及采用pull方式的消息队列Kafka,使读者可以快速了解RabbitMQ与Kafka的典型应用。
(7) 分布式协调服务篇对Zookeeper的常用命令、应用实例以及编程方法进行了实例化说明,帮助读者掌握Zookeeper管理和分布式系统协调控制的典型应用。
本书特点:
本书的7篇共含18章,每章均以实验环境搭建、基本操作、编程实践、应用实践任务作为业务流程进行编写,方便读者由浅入深地动手实践学习。此外,本书的实验内容均在华为ECS和MRS平台中实现,并展示了MRS平台的环境搭建细节,为计算机专业学生和软件程序设计师学习国产化软件提供了技术启蒙与指导。扫描下方二维码,访问本书教学网站,可在该网站下载本书配套源代码和实验文件,反馈书中错误和查看作者勘误信息。
教学网站
适用对象:
本书可作为高等学校计算机专业大数据课程的实践教材,也可以作为大数据处理从业者的参考用书。
致谢:
本书由辛宇、钱江波主要负责书稿的组织编写工作,陈叶芳、罗思惠参与编写,感谢宁波大学陈海明、严迪群老师在本书的编写过程中提供的专业指导,感谢刘祎、李雨潇、李振涛、黄俊仁、赵家池、林志浩、程卓和徐艺婉等同学的实验案例探索。另外,本教材的撰写受到了华为技术有限公司杨婷婷、郑芳芳和习志平老师的大力支持,华为“智能基座”产教融合协同育人基地项目提供了云资源,“华为布道师计划”给予了支持,在此表示衷心的感谢!
作者2026年3月
