【发布时间】:2014-04-20 12:16:46
【问题描述】:
我开始使用 pandas,并且在较大的 DataFrame 中有 一列数据,例如
0 one two
1 two seven six
2 three one five
3 seven five five eight
4 six four
5 three
dtype: object
我想做的是将单词序列拆分为它们的组成部分,然后为单词获取一个唯一的集合或计数。我可以很好地进行拆分
numbers.str.split(' ')
0 [one, two]
1 [two, seven, six]
2 [three, one, five]
3 [seven, five, five, eight]
4 [six, four]
5 [three]
dtype: object
但是,我不确定从这里去哪里。同样,我想要输出,例如
['one', 'two', 'three', 'four', 'five', 'six', 'seven', 'eight']
或在带有计数的字典中相同,或在这两者之一的 Series/DataFrame 等效项中。
到目前为止,我能做的最好的事情就是将 apply() 与 Set 结合使用来获取唯一的单词。到目前为止,pandas 是一个非常优雅的包,对于比我更了解它的人来说,这似乎是触手可及的。
提前致谢!
【问题讨论】:
-
我不会回答,因为可能有更有效的 Pandas 特定方式,但总的来说
itertools.chain.from_iterable()和collections.Counter会为你完成这项工作。
标签: python split pandas unique