【发布时间】:2021-08-31 18:39:14
【问题描述】:
我正在尝试过滤我的 DataFrame 以删除计数小于 100 的条目。“COMBINED”的 DataFrame 结果如下:
Row(movieID=26, avg(rating)=3.452054794520548, count=73)
当我运行下面的代码时,我收到以下错误:
TypeError:'method' 和 'int' 的实例之间不支持 '>='
movieDataset = spark.createDataFrame(movies)
movieratings = movieDataset.groupBy("movieID").mean().drop("avg(movieID)")
topMovieIDs = movieDataset.groupBy("movieID").count()
combined = movieratings.join(topMovieIDs, on=["movieID"], how='inner')
filtered = combined.filter(combined.count >= 100).collect()
如何通过 100 或更大的计数过滤 DataFrame?
【问题讨论】:
标签: python apache-spark filter pyspark