【发布时间】:2021-09-23 07:48:58
【问题描述】:
我有以下数据框:
| Category | Product |
|---|---|
| 63 | Z |
| 63 | Z |
| 63 | B |
| 63 | C |
| 83 | B |
| 83 | P |
| 84 | B |
| 84 | C |
| 84 | F |
| 85 | B |
| 85 | C |
| 85 | T |
| 85 | X |
| 85 | X |
| 85 | B |
我想获得 (4) 个类别中唯一(不同)的产品。它们可以是具有相同产品的同一类别中的多行,但是一旦产品出现在不同的类别中,我不希望他显示在新的数据框上。我想删除重复的行,除非它们属于同一类别而不属于其他类别。
输出:
| Category | Product |
|---|---|
| 63 | Z |
| 63 | Z |
| 83 | P |
| 84 | F |
| 85 | T |
| 85 | X |
| 85 | X |
我试图计算这样的唯一值,但没有成功:
new_df=df.drop_duplicates(['Category','Product'])[['Category','Product']]
我还想显示该类别中最常见的产品,但不幸的是,这些图表在类别中存在重复(例如 63 个类别)
new_df = df[df['Category'] == 63].copy()
new_df['Product'].value_counts()[:10].plot(kind='barh')
【问题讨论】:
-
到目前为止你有什么尝试?
-
我已经添加了我的代码@ExtraFishness