【发布时间】:2019-05-01 21:06:30
【问题描述】:
刚接触数据科学,想从事一个简单的项目(使用 Jupyter Notebook 和 Python 3.7)。基本上我想用 NLP 来查找美国电视节目前 50 名中最常见的短语。然而,我遇到了一个障碍。我拥有的数据集将节目的季节存储为单独的条目。例如,我有一些看起来像这样的东西:
- 南方公园第 14 季
- 合家欢第三季
- 南方公园第 10 季
- 南方公园第 11 季
- 南方公园第 13 季
- 合家欢第 1 季
- 生活大爆炸第 8 季
我对前 50 个独特节目感兴趣。有没有办法过滤或删除 Pandas DataFrame 中的类似条目?可以保留第一个条目但删除所有其他条目的东西? (我计划从每个节目中收集每一集的成绩单,因此只要删除类似条目以为其他独特条目腾出空间,电视节目的第一个实例就无关紧要了)。
我正在尝试找出可以返回这个的东西(基于上面的示例):
- 南方公园第 14 季
- 合家欢第三季
- 生活大爆炸第 8 季
不幸的是,我是一个新手,不知道从哪里开始,无论是正则表达式、字符串切片等。
感谢您的帮助!
【问题讨论】:
-
请在问题中添加您尝试过的任何内容。谢谢。
标签: python pandas dataframe data-science data-munging