【发布时间】:2021-03-11 08:49:03
【问题描述】:
我正在尝试通过开始投手的名字来对 MLB 数据进行聚类。我梳理了我正在使用的数据,没有任何值为 na 的数据,我在下面的代码中省略了它们。 Clustdata 对我来说看起来非常好ClustData preview 但我收到此错误:
在 hclust(d, method = "single", members = clustdata[, 1]) 中由 coercionError 引入的 NA: 外部函数调用中的 NA/NaN/Inf (arg 7)
我想通过这些属性按投手名称对该表进行聚类 谁有想法?谢谢!我是 R 新手
data7 = read.csv("GL2007.csv", header = T)
data8 = data.frame(na.omit(data7[c(10,23,24,25,26,30,31,33,105)]))
scoreagg = aggregate(v_score ~ h_starting_pitcher_name, data8, mean)
hitsagg = aggregate(v_hits ~ h_starting_pitcher_name, data8, mean)
doubagg = aggregate(v_doubles~ h_starting_pitcher_name, data8, mean)
tripagg = aggregate(v_triples~ h_starting_pitcher_name, data8, mean)
hragg = aggregate(v_homeruns ~ h_starting_pitcher_name, data8, mean)
hbpagg = aggregate(v_hit_by_pitch ~ h_starting_pitcher_name, data8, mean)
walksagg = aggregate(v_walks~ h_starting_pitcher_name, data8, mean)
SOagg = aggregate(v_strikeouts~ h_starting_pitcher_name, data8, mean)
clustdata = data.frame(scoreagg$h_starting_pitcher_name, scoreagg$v_score,hitsagg$v_hits,doubagg$v_doubles,tripagg$v_triples,hragg$v_homeruns,hbpagg$v_hit_by_pitch,walksagg$v_walks,SOagg$v_strikeouts)
library(NbClust)
d = dist(as.matrix(clustdata[,2:9]), method = "euclidean")
hc_1 = hclust(d, method = "single", members = clustdata[,1])
【问题讨论】:
标签: r