【发布时间】:2020-11-07 14:03:16
【问题描述】:
我想计算每个日期有多少句子包含特定单词。 例如:
Date Sentences
2020-10-22 Word1 bla bla bla Word2
2020-10-22 Bla bla bla bla
2020-10-22 Word3 bla bla
2020-10-22 Word1 bla bla bla
2020-10-23 Word3 bla
2020-10-23 Word1 bla bla
...
我要搜索的单词用 Wordx 标识(这只是一个示例,它们是 trump、money 等单词),而 bla bla bla 只是其他文本(例如,不会赢,... )。 对于每个单词,Word1,Word3,...,我想知道它在特定日期的句子中使用的次数。 我的方法是创建一个我想在我的句子中查找的特定单词的列表,并使用 groupby 日期来查看它们的日期,总结每个单词在一段时间内使用的次数。 所以是这样的:
Mylist=[‘word1’,’word3’]
df[‘Sentences’].str.contains(‘|’, Mylist).groupby([‘Date’]).sum()
我没有得到预期的输出,所以我认为我在我的代码中写了错误的东西,或者可能是他的问题的错误方法。
我想要这样的东西:
Word1 Freq
2020-10-22 2
2020-10-23 1
Word3 Freq
2020-10-22 1
2020-10-23 1
【问题讨论】:
-
也许使用以单词为键并将结果数据框作为值的字典?