【问题标题】:Spark Dataframe Maximum Column CountSpark Dataframe 最大列数
【发布时间】:2016-09-08 01:19:52
【问题描述】:

spark Dataframe 的最大列数是多少?我尝试从数据框文档中获取它,但找不到它。

【问题讨论】:

  • 简短的回答是有限制-阅读this answer以获得更全面的解释。

标签: apache-spark pyspark apache-spark-sql


【解决方案1】:

从架构的角度来看,它们是可扩展的,因此对列数不应该有任何限制,但它可能会导致节点上的负载不均匀,并可能影响转换的整体性能。

【讨论】:

  • 不正确。您可以轻松找到硬限制 (Int.MaxValue),但更重要的是,Spark 只能很好地扩展较长且相对较细的数据。从根本上说,您不能在执行程序/分区之间拆分单个记录。并且有许多实际限制(GC、磁盘 IO)使得非常宽的数据不切实际。更不用说一些已知的错误了。
  • 就此而言,大多数(据我所知)编程模型“很好”地扩展了长而细的数据。 (由于一个基本原因,记录将被打破以在阈值之后写入下一个相关的存储“逻辑单元”。)大多数“大数据”框架旨在处理没有限制的数据,如果你克服了技术限制,但性能受到影响。所以我认为我们会在达到上述限制之前出现内存错误。你的想法?
  • 这是一个旧条目,但我同意 @zero323 对此的看法。大数据框架具有上述评论中提到的限制。这种框架不适用于广泛的数据。我之前已经尝试过,但不幸的是,由于 NDA,我无法分享该基准。
猜你喜欢
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 2016-05-15
  • 1970-01-01
  • 1970-01-01
  • 2017-04-26
  • 1970-01-01
  • 2019-03-17
相关资源
最近更新 更多