【发布时间】:2016-03-28 20:32:09
【问题描述】:
我们正在考虑使用 Spark 重新开发我们现有的应用程序。
我们现有的领域模型(目前C# 类)将被重构为 RDD,当前修改领域模型的逻辑将被重构为转换 RDD 的函数。
问题是如何将域类最好地建模为 RDD。
最简单的方法是将其建模为Map<String, Any>。
然后可以使用 sparkContext.parallelize(map). 将其作为 RDD 加载到 Spark 中
另一种方法是在 Scala 中创建一个域类(可能是 case class)并将其加载为 RDD。 RDD 中的每个元素(或“行”)都将成为该类的一个实例。但是,这被认为是正确的方法还是最佳实践?而且,如果这是一种有意义的方法,那么如何将 Scala 类作为 RDD 加载到 Spark 中?
谢谢
【问题讨论】:
标签: apache-spark