【发布时间】:2020-06-06 23:33:54
【问题描述】:
我有这个用例,我在 Spark 中加入两个数据帧,A 和 B。
A -> Huge dataframe approx size: 100 TB
B -> Smaller dataframe approx size: 100 MB
两个问题:
- 如何减少网络随机播放,因为 spark UI 显示随机读取大约 30gb。
- 任务的数量也很大,大约 1,000,000。有什么减少它们的小窍门吗?
我曾尝试缓存数据帧A,但令人惊讶的是它只会让工作变慢。
任何帮助将不胜感激。
【问题讨论】:
-
能否发布 spark ui 并尽可能编写代码
-
@Srinivas 恐怕我不能,因为它不是我的个人代码。无论如何,代码更具理论性,对连接没有太多期望。
-
好的,这也取决于您在代码中使用联接的方式..您可以发布您的 spark-submit 命令吗??
-
如果只有 100MB 连接表,广播可能会对您有所帮助:jaceklaskowski.gitbooks.io/mastering-spark-sql/…
标签: scala apache-spark hdfs