【发布时间】:2016-05-09 03:50:03
【问题描述】:
我有一个如下所示的 DataFrame。我需要根据现有列创建一个新列。
col1 col2
a 1
a 2
b 1
c 1
d 1
d 2
输出数据框如下所示
col1 col2 col3 col4
a 1 1 2
a 2 1 2
b 1 0 1
c 1 0 1
d 1 1 2
d 2 1 2
我用来查找 col3 的逻辑是 如果 col1 的计数 > 1 并且 col4 是 col2 的最大值。
我熟悉如何在 sql 中执行此操作。但是很难找到使用数据帧 DSL 的解决方案。任何帮助,将不胜感激。谢谢
【问题讨论】:
标签: scala apache-spark dataframe spark-dataframe