第5章 舞台与调度:架构


文档摘要

第 5 章 · 舞台与调度:架构 章节摘要:三幕剧需要舞台——集群的进程模型、资源管理与任务调度。本章先看经典 v1 架构(JobTracker 加 TaskTracker)如何工作又为何成为瓶颈,再看 YARN 如何把资源管理与计算框架解耦成通用操作系统,最后补齐让三幕剧在中途翻车时仍能演完的容错机制:重试、心跳、黑名单与推测执行。 学习目标 阅读完本章,你应当能够: 画出 v1 的进程拓扑并说明 JobTracker 的两重职责; 解释 v1 在扩展性与多框架共存上的两大瓶颈; 描述 YARN 三角色(ResourceManager、NodeManager、ApplicationMaster)的分工与一次作业提交的完整交互; 说清任务级、作业级、节点级三层容错各自的触发与动作;

第 5 章 · 舞台与调度:架构

章节摘要:三幕剧需要舞台——集群的进程模型、资源管理与任务调度。本章先看经典 v1 架构(JobTracker 加 TaskTracker)如何工作又为何成为瓶颈,再看 YARN 如何把资源管理与计算框架解耦成通用操作系统,最后补齐让三幕剧在中途翻车时仍能演完的容错机制:重试、心跳、黑名单与推测执行。

学习目标

阅读完本章,你应当能够:

  1. 画出 v1 的进程拓扑并说明 JobTracker 的两重职责;
  2. 解释 v1 在扩展性与多框架共存上的两大瓶颈;
  3. 描述 YARN 三角色(ResourceManager、NodeManager、ApplicationMaster)的分工与一次作业提交的完整交互;
  4. 说清任务级、作业级、节点级三层容错各自的触发与动作;
  5. 解释推测执行的判定条件与"非幂等任务不可开"的原因。

核心概念速览

图 5-1 从 v1 到 YARN 的职责拆分

YARN 的本质动作只有一个:把"管集群"与"管作业"拆开,从此一个集群可以同时跑多种计算框架。

子章节导航

5.1 经典架构 v1

进程拓扑、心跳与槽位模型、作业提交后的调度流程,以及单点在扩展性与利用率上的先天缺陷。

5.2 YARN 架构

三角色分工、容器概念、一次 MapReduce 作业在 YARN 上的完整生命周期(含 MR ApplicationMaster 的职责)。

5.3 容错与推测执行

三层容错网(任务重试、作业恢复、节点拉黑)、心跳超时判定,以及推测执行"慢任务开备份、先到先得"的机制与安全边界。

子章节之间的逻辑关系

一句话论点:5.1 立 v1 的问题,5.2 给 YARN 的解,5.3 讲两代架构共享的翻车自愈机制。

v1 进程模型与瓶颈 │ 问题 资源管理 与 作业管理 耦合 ▼ YARN 拆分三角色 │ 收益 通用调度 多框架共存 ▼ 容错与推测执行 舞台的安全网

前置知识与后续延伸

  • 前置:第 4 章的 Reduce 慢启动(调度时机问题的伏笔);第 2 章数据本地性(YARN 的本地性调度延续同一思想)。
  • 为后续铺垫:本章的执行视图是第 6 章实战排错(作业卡在哪、日志去哪看)的平台基础;YARN 也为第 7 章"计算引擎换血、集群调度不动"的演进叙事埋线。

作者与出处
原作者: 灏天文库
来源:灏天文库
整理: 灏天文库整理
由灏天文库平台收录,内容或由平台用户上传,仅供学习交流
发布者: 作者: 灏天文库 转发
评论区 (0)
U