第 1 章 · 数据旅程的起点:Hadoop 全景 章节摘要:任何一段数据的 Hadoop 之旅都始于一个基本矛盾——数据大到单机存不下、算不动。本章建立全程地图:大数据挑战为什么催生分布式架构,Hadoop 三大组件(HDFS、MapReduce、YARN)如何按"存储、计算、资源"分工衔接,以及三种部署模式分别对应什么学习与生产场景。 学习目标 阅读完本章,你应当能够: 说清"海量"给存储与计算各自带来的具体瓶颈(容量、IO 带宽、单点故障); 用数据流动的视角描述 HDFS、MapReduce、YARN 各自守在旅程的哪一站; 解释"数据本地性"为什么是 Hadoop 设计的第一性原理; 区分单机模式、伪分布式、完全分布式的差异并做出选择; 完成一次伪分布式环境的搭建与验证。
章节摘要:任何一段数据的 Hadoop 之旅都始于一个基本矛盾——数据大到单机存不下、算不动。本章建立全程地图:大数据挑战为什么催生分布式架构,Hadoop 三大组件(HDFS、MapReduce、YARN)如何按"存储、计算、资源"分工衔接,以及三种部署模式分别对应什么学习与生产场景。
阅读完本章,你应当能够:
一句行话概括 Hadoop 的全部哲学:移动计算比移动数据便宜得多。
从"单机为什么不行"讲起,给出数据从生到消费的完整旅程地图,本章其余内容都挂在这张图上。
NameNode、DataNode、块、作业、任务、容器这些基本角色集中登场,用一次文件上传把它们串起来。
单机、伪分布式、完全分布式的结构差异、资源开销与适用场景,附伪分布式关键配置。
三节的顺序就是"问题 → 概念 → 落地":
[1.1 为什么要分布式] ──提出矛盾──▶ [1.2 组件如何分工] ──给出结构──▶ [1.3 怎么跑起来] 数据旅程地图 一次上传的全程回放 部署模式选择
1.1 制造张力,1.2 给出解法的骨架,1.3 让你亲手把骨架立起来。之后第 2 章立即深入旅程第一站——写入 HDFS。