【发布时间】:2018-01-29 23:21:54
【问题描述】:
我正在尝试导入一个大型的化学分析环境数据集。该数据集组织如下:
- 首先
10 columns是样本信息(例如实验室、监测站、日期、坐标等)。 - 随后的
(more than 90 columns)是对不同变量(例如铝、pH、铜等)的观察结果
最大的问题是左删失数据被写成"< 0.02",每个参数的这个值是不同的。当我导入csv 文件时,其中至少有一个左删失值的所有列都被导入为Factor datatype。我想用一个基本规则替换每一个左审查:
- Replace "< X" for value "X/sqrt(2)".
这只是一个示例,说明我最初希望如何管理这些数据。更换每根色谱柱是不可行的,因为参数太多,即使在相同的参数和实验室内(假设实验室设备更新),阈值也可能会有所不同。
提前谢谢你。
注意:为了更具体,我上传了我的数据集的摘录。 可在此处获得: http://www.filehosting.org/file/details/722215/sample.csv
【问题讨论】:
-
这种策略的缺点是值“
-
我是 R 新手。理论上,我可以考虑在一个函数中识别以“
-
您的评论令人困惑。它表明我们还不知道您的数据当前是如何表示的。如果它是一个 csv 文件,其中“read. 函数都不会考虑该列数字,除非您强制它如此......然后其中带有“
-
很抱歉让您如此困惑。我在编辑中上传了一个示例文件。我通过 Rstudio 导入它们没有问题,但是当至少有一个“