【发布时间】:2016-11-17 13:00:23
【问题描述】:
我正在研究 spark mllib 算法。我拥有的数据集就是这种形式
Company":"XXXX","CurrentTitle":"XYZ","Edu_Title":"ABC","Exp_mnth":.(还有更多类似的值)
我正在尝试将字符串值原始编码为数字值。因此,我尝试使用 zipwithuniqueID 为每个字符串值获取唯一值。由于某种原因,我无法将修改后的数据集保存到磁盘。我可以使用 spark SQL 以任何方式执行此操作吗?或者有什么更好的方法?
【问题讨论】:
-
对不起..我想出了这个线程stackoverflow.com/questions/33102727/…
-
能否请您删除您的问题(因为它是重复的)?谢谢。
标签: apache-spark apache-spark-sql spark-dataframe apache-spark-mllib