【发布时间】:2012-07-04 08:56:50
【问题描述】:
我有一个数据集,其中数据检查显示以下一些内容,所有这些都应该丢失
'missing'
'unknown'
'uncoded'
我认为我可以用 "NA" 替换所有出现的这些是正确的吗?这是首选的方法吗?
var[var=='missing'] <- NA
var[var=='unknown'] <- NA
var[var=='uncoded'] <- NA
【问题讨论】:
-
“首选”方式很可能取决于您尝试进行的分析,因此您可能会得到很多意见答案。也许将问题改写为“R如何表示丢失的数据”可能会有所帮助。然而,这个问题的答案可能已经存在了。
-
谢谢,但我认为丢失的数据总是表示为 NA ?我一直只处理已经编码为 NA 的数据,但这次我有这些其他编码。
-
啊,我不知道您指的是首选的重新编码方式还是处理缺失值的首选方式。如果您确定要将它们编码为
NA,那么您还可以考虑NA_character_、NA_integer_等(列在?"NA"下) -
本巴恩斯,对不起。为了澄清,我指的是编码缺失数据的方式。实际上我将使用
mice包来估算这些缺失值。我正在自学 R,还没有太多经验。
标签: r