【发布时间】:2016-04-25 18:25:18
【问题描述】:
我有两个从两个 csv 文件加载的数据框。例子:
old
+--------+---------+----------+
|HOTEL ID|GB |US |
+--------+---------+----------+
| 80341| 0.78| 0.7|
| 255836| 0.6| 0.6|
| 245281| 0.78| 0.99|
| 229166| 0.0| 0.7|
+--------+---------+----------+
new
+--------+---------+----------+
|HOTEL ID|GB |US |
+--------+---------+----------+
| 80341| 1 | 0.7|
| 255836| 0.6| 1 |
| 245281| 0.78| 0.99|
| 333 | 0.0| 0.7|
+--------+---------+----------+
我想得到:
expected result
+--------+---------+----------+
|HOTEL ID|GB |US |
+--------+---------+----------+
| 80341| 1 | None|
| 255836| None| 1 |
| 333 | 0.0| 0.7|
+--------+---------+----------+
我一直在摆弄 dataframe foreach 方法,但未能使其工作......作为一个火花新手,如果有任何线索,我将不胜感激。
干杯!
拉斐尔
【问题讨论】:
-
其实可以得到最后一个|333|0.0|0.7|通过使用减法()进行行,但仍然对逐个单元格的比较一无所知。
标签: dataframe pyspark spark-csv