7.2 与NoSQL数据库集成:把扫描并行化 本节摘要:Spark 读 NoSQL 行存(HBase、Cassandra、MongoDB 等)时,连接器把表按分区键切成 scan 区间分派给任务。本节以 HBase 与 Cassandra 为样本,看切片从哪来、并行度怎么定、写回时的权衡,并归纳连接器的三种读模式。 上一节的数据躺在文件系统里,块边界就是天然的分区边界。 会员。《7.2 与NoSQL数据库集成:把扫描并行化》收录于灏天文库文集《Spark大数据分析与处理实战》,原作者/来源:灏天文库,整理自「灏天文库」,提供技术教程、实践指南与问题解决方案,支持在线阅读、全文检索与知识沉淀,助力开发者系统化学习。本站整理收录,版权归原作者/开源协议所有。