第2章 Spark SQL与DataFrame


文档摘要

第2章 Spark SQL 与 DataFrame 本章要回答的三个问题:①一行 SQL 敲下去,引擎在把它变成 Task 之前做了哪些"改写"?②DataFrame 和 RDD 明明是两套 API,为什么跑在同一台引擎上?③拿到一份慢查询,怎么从执行计划里读出病灶? 为什么会有这一章 RDD API 把执行细节全部交给写代码的人:怎么分区、怎么缓存、先过滤还是先聚合,全凭手感。团队一大,手感参差不齐,引擎再快也架不住糟糕的血统图。 会员。《第2章 Spark SQL与DataFrame》收录于灏天文库文集《Spark大数据分析与处理实战》,原作者/来源:灏天文库,整理自「灏天文库」,提供技术教程、实践指南与问题解决方案,支持在线阅读、全文检索与知识沉淀,助力开发者系统化学习。本站整理收录,版权归原作者/开源协议所有。

该文档为会员专享,请先登录或注册后再查看


作者与出处
原作者: 灏天文库
来源:灏天文库
整理: 灏天文库整理
由灏天文库平台收录,内容或由平台用户上传,仅供学习交流
发布者: 作者: 灏天文库 转发
评论区 (0)
U