第1章 数据旅程的起点:Hadoop全景


文档摘要

第 1 章 · 数据旅程的起点:Hadoop 全景 章节摘要:任何一段数据的 Hadoop 之旅都始于一个基本矛盾——数据大到单机存不下、算不动。本章建立全程地图:大数据挑战为什么催生分布式架构,Hadoop 三大组件(HDFS、MapReduce、YARN)如何按"存储、计算、资源"分工衔接,以及三种部署模式分别对应什么学习与生产场景。 学习目标 阅读完本章,你应当能够: 说清"海量"给存储与计算各自带来的具体瓶颈(容量、IO 带宽、单点故障); 用数据流动的视角描述 HDFS、MapReduce、YARN 各自守在旅程的哪一站; 解释"数据本地性"为什么是 Hadoop 设计的第一性原理; 区分单机模式、伪分布式、完全分布式的差异并做出选择; 完成一次伪分布式环境的搭建与验证。

第 1 章 · 数据旅程的起点:Hadoop 全景

章节摘要:任何一段数据的 Hadoop 之旅都始于一个基本矛盾——数据大到单机存不下、算不动。本章建立全程地图:大数据挑战为什么催生分布式架构,Hadoop 三大组件(HDFS、MapReduce、YARN)如何按"存储、计算、资源"分工衔接,以及三种部署模式分别对应什么学习与生产场景。

学习目标

阅读完本章,你应当能够:

  1. 说清"海量"给存储与计算各自带来的具体瓶颈(容量、IO 带宽、单点故障);
  2. 用数据流动的视角描述 HDFS、MapReduce、YARN 各自守在旅程的哪一站;
  3. 解释"数据本地性"为什么是 Hadoop 设计的第一性原理;
  4. 区分单机模式、伪分布式、完全分布式的差异并做出选择;
  5. 完成一次伪分布式环境的搭建与验证。

核心概念速览

一句行话概括 Hadoop 的全部哲学:移动计算比移动数据便宜得多。

子章节导航

1.1 大数据挑战与数据旅程地图

从"单机为什么不行"讲起,给出数据从生到消费的完整旅程地图,本章其余内容都挂在这张图上。

1.2 Hadoop 核心概念与数据流视角

NameNode、DataNode、块、作业、任务、容器这些基本角色集中登场,用一次文件上传把它们串起来。

1.3 Hadoop 的部署模式

单机、伪分布式、完全分布式的结构差异、资源开销与适用场景,附伪分布式关键配置。

子章节之间的逻辑关系

三节的顺序就是"问题 → 概念 → 落地":

[1.1 为什么要分布式] ──提出矛盾──▶ [1.2 组件如何分工] ──给出结构──▶ [1.3 怎么跑起来] 数据旅程地图 一次上传的全程回放 部署模式选择

1.1 制造张力,1.2 给出解法的骨架,1.3 让你亲手把骨架立起来。之后第 2 章立即深入旅程第一站——写入 HDFS。

前置知识与后续延伸

  • 前置:Linux 命令行基础(ls、ssh、tar),会看 XML 配置即可。
  • 为后续铺垫:本章的旅程地图与角色表是第 2 章(存储站)、第 3 章(计算站)、第 4 章(资源站)的总索引;1.3 的伪分布式环境是后续所有动手环节的实验台。

作者与出处
原作者: 灏天文库
来源:灏天文库
整理: 灏天文库整理
由灏天文库平台收录,内容或由平台用户上传,仅供学习交流
发布者: 作者: 灏天文库 转发
评论区 (0)
U