第 5 章 · 舞台与调度:架构 章节摘要:三幕剧需要舞台——集群的进程模型、资源管理与任务调度。本章先看经典 v1 架构(JobTracker 加 TaskTracker)如何工作又为何成为瓶颈,再看 YARN 如何把资源管理与计算框架解耦成通用操作系统,最后补齐让三幕剧在中途翻车时仍能演完的容错机制:重试、心跳、黑名单与推测执行。 学习目标 阅读完本章,你应当能够: 画出 v1 的进程拓扑并说明 JobTracker 的两重职责; 解释 v1 在扩展性与多框架共存上的两大瓶颈; 描述 YARN 三角色(ResourceManager、NodeManager、ApplicationMaster)的分工与一次作业提交的完整交互; 说清任务级、作业级、节点级三层容错各自的触发与动作;
章节摘要:三幕剧需要舞台——集群的进程模型、资源管理与任务调度。本章先看经典 v1 架构(JobTracker 加 TaskTracker)如何工作又为何成为瓶颈,再看 YARN 如何把资源管理与计算框架解耦成通用操作系统,最后补齐让三幕剧在中途翻车时仍能演完的容错机制:重试、心跳、黑名单与推测执行。
阅读完本章,你应当能够:
YARN 的本质动作只有一个:把"管集群"与"管作业"拆开,从此一个集群可以同时跑多种计算框架。
进程拓扑、心跳与槽位模型、作业提交后的调度流程,以及单点在扩展性与利用率上的先天缺陷。
三角色分工、容器概念、一次 MapReduce 作业在 YARN 上的完整生命周期(含 MR ApplicationMaster 的职责)。
三层容错网(任务重试、作业恢复、节点拉黑)、心跳超时判定,以及推测执行"慢任务开备份、先到先得"的机制与安全边界。
一句话论点:5.1 立 v1 的问题,5.2 给 YARN 的解,5.3 讲两代架构共享的翻车自愈机制。
v1 进程模型与瓶颈 │ 问题 资源管理 与 作业管理 耦合 ▼ YARN 拆分三角色 │ 收益 通用调度 多框架共存 ▼ 容错与推测执行 舞台的安全网