小文件导致任务执行缓慢的原因:

1.很容易想到的是map task 任务启动太多,而每个文件的实际输入量很小,所以导致了任务缓慢

   这个可以通过 CombineTextInputFormat,解决,主要需要设置 mapreduce.input.fileinputformat.split.maxsize(单位byte)

2.其次是set input 文件太多,需要一个一个set ,所以花费的时间很多,导致任务启动就很慢了

   这个只能提前merge好小文件,组成大文件,可能还有更好的办法,需要再研究

相关文章:

  • 2022-12-23
  • 2021-10-25
  • 2022-01-16
  • 2022-12-23
  • 2022-12-23
  • 2021-08-02
  • 2022-12-23
  • 2022-03-10
猜你喜欢
  • 2021-11-03
  • 2022-03-08
  • 2022-12-23
  • 2022-12-23
  • 2021-12-06
  • 2021-05-20
  • 2021-10-17
相关资源
相似解决方案