切片与MapTask并行度决定机制

1、影响


MapTask的并行度决定Map阶段的任务处理并发度,进而影响到整个Job的处理速度。

 

2、MapTask并行度决定机制


数据块:Block是HDFS物理上把数据分成一块一块。
数据切片:数据切片只是在逻辑上对输入进行分片,并不会在磁盘上将其切分成片进行存储。

 

下面是详细的数据切片与MapTask并行度决定机制

切片与MapTask并行度决定机制