【发布时间】:2018-12-04 06:20:18
【问题描述】:
假设我的数据框如下所示:
column_name
1 book
2 fish
3 icecream|book
4 fish
5 campfire|book
现在,如果我使用df['column_name'].value_counts(),它会告诉我fish 是最常见的值。
但是,我希望返回 book,因为第 1、3 和 5 行包含单词“book”。
我知道.value_counts() 将icecream|book 识别为一个值,但是有没有一种方法可以通过计算每个列单元格包含某个值的次数来确定最常见的值,这样“book”将最频繁值?
【问题讨论】:
-
从技术上讲,正如您所说的那样,它应该返回“o”,因为这是最常见的值,或者“i”,因为这是大多数行包含的值。如果你想让python计算词频,你必须告诉它什么是“词”,即分隔符是什么。
标签: python pandas dataframe counting