【发布时间】:2017-05-28 21:27:16
【问题描述】:
我有一个 pandas.DataFrame 有 2 列,其中包含酒精的类型(即 VODKA 80 PROOF、加拿大威士忌、五香朗姆酒)和售出的瓶数。我想首先将其分类为粒度较小的类别,即(威士忌、伏特加、朗姆酒),然后将每个类别销售的所有瓶子相加。
我的代码不允许我隔离“VODKA”等标签,而是返回“VODKA 80 Proof”等类别的频率。
在:
top_N = 10 # top 10 most used categories
word_dist = nltk.FreqDist(df['Category Name'])
print('All frequencies:')
print('=' * 60)
rslt = pd.DataFrame(word_dist.most_common(top_N),
columns=['Word', 'Frequency'])
print(rslt)
print('=' * 60)
df= df.groupby('Category Name')['Bottles Sold'].sum()
输出:
All frequencies:
============================================================
Word Frequency
0 VODKA 80 PROOF 35373
1 CANADIAN WHISKIES 27087
2 STRAIGHT BOURBON WHISKIES 15342
3 SPICED RUM 14631
4 VODKA FLAVORED 14001
5 TEQUILA 12109
6 BLENDED WHISKIES 11547
7 WHISKEY LIQUEUR 10902
8 IMPORTED VODKA 10668
9 PUERTO RICO & VIRGIN ISLANDS RUM 10062
============================================================
有什么想法吗?
【问题讨论】:
标签: python pandas count frequency