【发布时间】:2017-01-31 17:00:14
【问题描述】:
我有兴趣对具有时间固定值和时变值的敏感数据集进行去标识化。我想 (a) 按社会保险号对所有案例进行分组,(b) 为这些案例分配一个唯一 ID,然后 (c) 删除社会保险号。
这是一个示例数据集:
personal_id gender temperature
111-11-1111 M 99.6
999-999-999 F 98.2
111-11-1111 M 97.8
999-999-999 F 98.3
888-88-8888 F 99.0
111-11-1111 M 98.9
非常感谢任何解决方案。
【问题讨论】:
-
也许是一个懒惰的解决方案,但我想你可以散列社会安全号码。
-
一种方法是
set.seed(1234); levels(personal_id) <- sample(length(levels(personal_id)))在这里,种子会提供一个“解密”密钥,所以你要么隐藏它,要么不保存它。