【发布时间】:2022-01-08 06:45:50
【问题描述】:
我有一个包含组、ID 和目标列的数据集。我试图通过 Group 列消除空目标值,忽略 ID 列。我想在 PySpark 中执行此操作。
| Group | ID | Target |
| ----- | --- | -------- |
| A | B | 10 |
| A | B | 10 |
| A | B | 10 |
| A | C | null |
| A | C | null |
| A | C | null |
| B | D | null |
| B | D | null |
| B | D | null |
这是我正在寻找的结果数据集:
| Group | ID | Target |
| ----- | --- | -------- |
| A | B | 10 |
| A | B | 10 |
| A | B | 10 |
| B | D | null |
| B | D | null |
| B | D | null |
换句话说,如果组已经有一个目标值,我不需要该组中具有空目标的值,无论它们的 ID 是什么。但是,我需要确保每个组都有一个不为空的目标,所以如果有一个组只有空目标,它们就不能被删除。
【问题讨论】: