【发布时间】:2018-07-13 00:21:38
【问题描述】:
我有两个DataFrames,其中有一些这样的数据,
+-------+--------+------------------+---------+
|ADDRESS|CUSTOMER| CUSTOMERTIME| POL |
+-------+--------+------------------+---------+
| There| cust0|3069.4768999023245|578596829|
| There| cust0|3069.4768999023245|43831451 |
| Here| cust1| 15.29206776391711|578596829|
| There| cust0|3069.4768999023245|43831451 |
| Here| cust1| 15.29206776391711|578596829|
| Here| cust4| 32.04741866436953|43831451 |
+-------+--------+------------------+---------+
和
+---------+------------------+------------------+-----+-----+
| POLICY| POLICYENDTIME| POLICYSTARTTIME|PVAR0|PVAR1|
+---------+------------------+------------------+-----+-----+
|578596829|3599.3427299724353|13.433243831334922| 2| 0|
|578596829|3599.3427299724353|13.433243831334922| 2| 0|
| 43831451|3712.2672901111655|1744.9884452423225| 0| 6|
|578596829|3599.3427299724353|13.433243831334922| 2| 0|
| 43831451|3712.2672901111655|1744.9884452423225| 0| 6|
| 43831451|3979.2754016079016|3712.2672901111655| 0| 5|
+---------+------------------+------------------+-----+-----+
现在我想比较这两个数据框以找到匹配的列,我可以在下一步中加入这些DataFrames(在这种情况下它将是POLICY 和POL)。有什么算法或其他方法可以预测吗?
【问题讨论】:
-
可以在
pyspark吗? -
@Bala 我正在寻找一种方法来找到我可以加入的两个数据框中的列。所以欢迎任何事情
标签: java apache-spark apache-spark-mllib