【发布时间】:2017-03-21 12:00:51
【问题描述】:
我有一个二维高斯分布,我正在尝试识别异常值。这不是去除异常值的意义,而是识别与主体最不相似的样本。
您对如何最好地处理这些数据有什么建议吗?我试图在两个维度上拟合正态分布并计算所有数据点的 p 值,然后将异常值识别为 p 值最低的数据点。但是,我得到以下结果:
这是计算P值的代码:
library(fitdistrplus)
norm_pvalue <- function(input_dist, input_values) {
# Fitting normal distribution
fit <- fitdist(input_dist, "norm")
# Calculating p-values
p_values <- unlist(lapply(input_values, function(x) dnorm(x = x, mean= fit$estimate[['mean']], sd= fit$estimate[['sd']])))
return(p_values)
}
我希望解决方案具有普遍性。
【问题讨论】:
-
求马氏距离质心?
标签: r normal-distribution outliers n-dimensional