【发布时间】:2019-01-25 11:12:06
【问题描述】:
我正在使用 Spark 进行一些大型数据处理。但我认为这个问题有点独立。我有以下数据集和其他一些列:
--------------------------------------------------
| Name | Corrected_Name |
--------------------------------------------------
| Pawan | Varun |
--------------------------------------------------
| Varun | Naresh |
--------------------------------------------------
| Dona | Pia |
--------------------------------------------------
现在我正在尝试更正所有名称,因此在这种情况下,我必须找到链 Pawan -> Varun -> Naresh。有没有办法在 Spark 或其他算法中处理这个问题?
【问题讨论】:
-
Pawan->Varun->Naresh表示现在所有Pawan和Varun都将是Naresh?如果是,那么只需找到最深的孩子,并用这个孩子值替换所有父母。
标签: algorithm apache-spark decision-tree