【发布时间】:2019-02-13 09:25:30
【问题描述】:
:)
我正在处理一个我想公开展示的庞大数据集(数据框),我想匿名化数据,所以我不想让用户的UUID像使用带有字符串的新列一样使用:
用户1,用户2,用户3,
明显对应另一栏的ID。
当/否则时我无法使用它们,因为我在 df 中有超过一千个不同的 uuids。
所以最终结果应该是这样的:
| UUID | User |
|uuid1 |user1 |
|uuid1 |user1 |
|uuid2 |user2 |
|uuid3 |user3 |
我尝试编写一个函数,每次uuid 更改时都会增加用户“名称”中的数字,但如果您有任何其他简单的想法,请告诉我! :)
【问题讨论】:
-
您可以只使用 UUID 创建一个单独的数据框,并使用
monotonically_increasing_id()添加一个新列,然后重新加入这个新列 -
请发布您的尝试实现以及初始数据框架构
标签: python dataframe pyspark uuid databricks