【发布时间】:2020-12-11 07:59:53
【问题描述】:
我想按原样聚合docvector,按unixReviewTime 排序,并从上面的原始pandas DataFrame 中按reviewerID 分组。我写的代码如下。
user_reviews = pd.pivot_table(df, index=["reviewerID","unixReviewTime"],values=["docvector"], aggfunc=lambda x: x)
结果,我得到了这个奇怪的 user_reviews DataFrame,它在每个 docvector 前面都有数字。这里是下图中的 80839、130296、128549、86624。这些数字在原版中没有。
这些数字是什么,为什么要创建它们,没有这些数字如何制作数据透视表?
【问题讨论】:
-
这是导致问题的原因:
aggfunc=lambda x: x你想使用什么聚合函数?那么 unixereviewtime 专栏呢?你也想对此进行分组吗? -
@IoaTzimas 我想保持 docvector 原样,所以我使用了这个函数。
-
为什么不直接使用排序?无需聚合就无需使用数据透视。试试
df.sort_values(by=["reviewerID","unixReviewTime"]) -
@IoaTzimas 谢谢。但我想使用
reviewerID作为索引。
标签: python pandas dataframe pivot-table