【问题标题】:how to add a Incremental column ID for a table in spark SQL如何在 Spark SQL 中为表添加增量列 ID
【发布时间】:2016-11-17 13:00:23
【问题描述】:

我正在研究 spark mllib 算法。我拥有的数据集就是这种形式

Company":"XXXX","CurrentTitle":"XYZ","Edu_Title":"ABC","Exp_mnth":.(还有更多类似的值)

我正在尝试将字符串值原始编码为数字值。因此,我尝试使用 zipwithuniqueID 为每个字符串值获取唯一值。由于某种原因,我无法将修改后的数据集保存到磁盘。我可以使用 spark SQL 以任何方式执行此操作吗?或者有什么更好的方法?

【问题讨论】:

标签: apache-spark apache-spark-sql spark-dataframe apache-spark-mllib


【解决方案1】:

斯卡拉

val dataFrame1 = dataFrame0.withColumn("index",monotonically_increasing_id())

Java

 Import org.apache.spark.sql.functions;
Dataset<Row> dataFrame1 = dataFrame0.withColumn("index",functions.monotonically_increasing_id());

【讨论】:

    猜你喜欢
    • 1970-01-01
    • 1970-01-01
    • 2015-12-08
    • 2021-12-27
    • 2015-12-23
    • 1970-01-01
    相关资源
    最近更新 更多