A.RDD(ResilientDistributedDataset)叫做弹性分布式数据集,是spark中最基本的数据抽象;
B.Resilient:表示弹性的;
C.Destributed:分布式,可以并行在集群计算;
D.Dataset:就是一个集合,用于存放数据的;
A.宽依赖指的是多个子RDD的分区会依赖同一个父RDD的分区,关系是一对多
B.窄依赖指的是每一个父RDD的分区最多被子RDD的一个分区使用,是一对一的
C.宽依赖中会有shuffle的产生
D.窄依赖中会有shuffle的产生
A.RDD Object->ADGScheduler->TaskScheduler->Worker
B.ADGScheduler->RDD Object->TaskScheduler->Worker
C.RDD Object->TaskScheduler->ADGScheduler->Worker
D.Worker->ADGScheduler->TaskScheduler->RDD Object