【发布时间】:2020-03-10 19:52:41
【问题描述】:
我正在研究机器学习,并希望实现 K 意味着聚类以更好地理解它。我有一个猫的数据集,每只猫都有 4 个测量值。我想根据这些属性将它们分成 2 个和 3 个不同的硬簇,看看是否可以根据这些测量确定它们的品种。
我熟悉通用算法,但我很难理解
- 我应该在中间随机分配哪些数字来初始化我的质心? 1到10?真的很重要吗?
- 如何找到
(x,y)元组和猫(有4 个属性)之间的欧几里得距离?
通常在欧几里得距离中,您将x、y 等值相互比较,但如果我有 4 个属性,我如何测量它与二维平面上的 (x,y) 对的距离?即使在阅读了这个概念之后,这对我来说也没有多大意义。
我相信在 2d 平面上我确实只能查看 4 个属性中的两个属性 - 或者这不正确吗?如果不将数据维度压缩到 2,我看不出如何做到这一点。
Ps:我知道有实现 K-means 聚类的库,这不是重点。
【问题讨论】:
标签: python algorithm machine-learning data-science