【发布时间】:2015-12-14 17:54:05
【问题描述】:
我需要从一个巨大的数据帧(或任何与 r 数据帧等效的 python)创建一个语料库,方法是将其拆分为多个数据帧作为用户名。
例如,我从这样的数据框开始:
username search_term
name_1 "some_text_1"
name_1 "some_text_2"
name_2 "some_text_3"
name_2 "some_text_4"
name_3 "some_text_5"
name_3 "some_text_6"
name_3 "some_text_1"
[...]
name_n "some_text_n-1"
我想获得:
data frame 1
username search_term
name_1 "some_text_1"
name_1 "some_text_2"
data frame 2
username search_term
name_2 "some_text_3"
name_2 "some_text_4"
等等……
我已经为 R 提出了这个问题,但现在我意识到使用 python NLTK 对我来说可能是一个优势。 我发现在 R i 中可以创建一个虚拟语料库。在python中是一样的吗?或者有没有其他方法可以在python中解决这个问题?
要了解我如何在 R 中解决此问题,请参阅:
Split a huge dataframe in many smaller dataframes to create a corpus in r
【问题讨论】:
标签: python r dataframe virtualization corpus