【发布时间】:2019-08-05 09:00:52
【问题描述】:
pyspark==2.4.0
这是给出异常的代码:
LDA = spark.read.parquet('./LDA.parquet/')
LDA.printSchema()
from pyspark.ml.clustering import KMeans
from pyspark.ml.evaluation import ClusteringEvaluator
kmeans = KMeans(featuresCol='topic_vector_fix_dim').setK(15).setSeed(1)
model = kmeans.fit(LDA)
根
|-- ID:字符串(可为空 = true)
|-- topic_vector_fix_dim: 数组(可为空=真)
| |-- 元素:double (containsNull = true)
IllegalArgumentException: '要求失败:列 topic_vector_fix_dim 的类型必须等于以下类型之一:[struct ,values:array >, array , array ] 但实际上是 array 类型。'
我很困惑 - 它不喜欢我的array <double>,但说它可能是输入。
topic_vector_fix_dim 的每个条目都是浮点数的一维数组
【问题讨论】: