【问题标题】:confusion on 2 dimension kernel density estimation in RR中二维核密度估计的混淆
【发布时间】:2016-12-10 05:30:18
【问题描述】:

核密度估计器用于估计特定的概率密度函数(参见mvstat.netsckit-learn docs 以获取参考)

我的困惑是kde2d() 到底做了什么?下例中是否估计了两个随机变量f(a,b)的联合分布概率密度函数?颜色是什么意思?

这是我所指的代码示例。

b <- log10(rgamma(1000, 6, 3))
a <- log10((rweibull(1000, 8, 2)))
density <- kde2d(a, b, n=100)

colour_flow <- colorRampPalette(c('white', 'blue', 'yellow', 'red', 'darkred'))
filled.contour(density, color.palette=colour_flow)

【问题讨论】:

  • Does it estimate the joint distribution probability density function of two random variables? - 是的。由于您现在有三个轴,rv1rv2estimated probability,您必须对其中一个轴进行颜色编码,以便能够在 2d 图形中显示它们。因此,您可以对概率进行颜色编码和/或绘制等概率的等高线。有关等高线的更多详细信息,请参见维基百科:en.wikipedia.org/wiki/Contour_line
  • 查看kde2d的源代码。一旦您知道 2d 正态核密度估计是两个 1d 正态 kdes 的乘积,通常很容易消除 2d kde 的歧义。
  • @cel,谢谢并投票,所以 darkred 颜色意味着(x,y) 的概率高于 white,对吗?是否也意味着在darkred区域,随机变量xy的相关性比white高?
  • @sayaa,谢谢并投票。所以在我的代码示例中,darkred 颜色意味着(x,y) 的概率高于white,对吗?是否也意味着在darkred区域,随机变量xy的相关性比white高?

标签: r statistics scikit-learn kernel-density probability-density


【解决方案1】:

什么是核密度估计器? 本质上,它在数据的每个点(法线密度的中心就是那个点)上拟合一条小法线密度曲线,然后将所有小法线密度加到核密度估计器中。

为了便于说明,我将添加来自one of your links 的一维核密度估计器的图像。

二维核密度呢?

# library(MASS)
b <- log10(rgamma(1000, 6, 3))
a <- log10((rweibull(1000, 8, 2)))
# a and b contain 1000 values each. 

density <- kde2d(a,b,n=100) 

该函数创建一个从min(a)max(a) 以及从min(b)max(b) 的网格。 kde2d 现在不是在ab 中的每个值上拟合微小的一维法线密度,而是在网格中的每个点上拟合微小的二维法线密度。就像在一维情况下的内核密度一样,它会将所有密度值相加。

颜色是什么意思? 正如@cel 在 cmets 中指出的那样:估计的概率取决于两个变量,所以我们现在有三个轴(abestimated probability)。可视化 3 轴的一种方法是使用 等概率轮廓。这听起来很花哨,但它与我们从天气预报中知道的高/低压图像基本相同。

你正在使用

filled.contour(density, 
    color.palette = colorRampPalette(c('white', 'blue', 'yellow', 'red', 'darkred')))))

因此,从低到高,图将被着色为whiteblueyellowred,最终以darkred 为估计概率的最高值。这导致以下情节:

【讨论】:

  • 谢谢肯,投票。所以在我的代码示例中,darkred 颜色意味着(x,y) 的概率高于white,对吗?是否也意味着在darkred区域,随机变量xy的相关性高于white
  • @LinMa 我编辑了帖子。颜色代表相关性,它们代表估计的联合密度值。由于kde2d 没有包含协方差矩阵来模拟ab 之间的关系,我确信它假定ab 中的值是独立的,即ab 是不相关。
  • 当变量相互关联时,意味着a的结果会影响b的结果。在问题中讨论的情况下,ab 中的结果恰好在深色区域中经常“相交”,这仅仅是因为a 恰好在0.250.35 范围内有许多值并且b0.30.4 范围内有许多值。直觉上,你可能会说知道a 的值并没有给你任何关于b 值的额外信息。
  • 我的意思正好相反;)看看维基百科什么是独立性,或不相关性。
  • 我将举例说明:假设有两个家庭聚会,您记录了客人的年龄。双方彼此无关,因此知道甲方客人#5的年龄,并不能提供乙方客人#5的年龄的任何信息(因此,年龄分布不相关且独立) .但是,如果我们像我的答案中的图那样绘制两个年龄分布,我们可能会在 20 到 30 年之间有一个深红色区域。”从这个例子中,我们看到相关性和深红色区域没有任何关系互相做​​。
猜你喜欢
  • 2015-12-20
  • 2013-07-23
  • 2011-04-28
  • 2015-07-20
  • 2014-04-14
  • 2021-01-25
  • 1970-01-01
  • 2012-11-23
  • 2017-05-25
相关资源
最近更新 更多