【问题标题】:Create a "virtual" corpus in python在 python 中创建一个“虚拟”语料库
【发布时间】:2015-12-14 17:54:05
【问题描述】:

我需要从一个巨大的数据帧(或任何与 r 数据帧等效的 python)创建一个语料库,方法是将其拆分为多个数据帧作为用户名。

例如,我从这样的数据框开始:

username    search_term
name_1      "some_text_1"
name_1      "some_text_2"
name_2      "some_text_3"
name_2      "some_text_4"
name_3      "some_text_5"
name_3      "some_text_6"
name_3      "some_text_1"

[...]

name_n      "some_text_n-1"

我想获得:

data frame 1
username    search_term
name_1      "some_text_1"
name_1      "some_text_2"

data frame 2
username    search_term
name_2      "some_text_3"
name_2      "some_text_4"

等等……

我已经为 R 提出了这个问题,但现在我意识到使用 python NLTK 对我来说可能是一个优势。 我发现在 R i 中可以创建一个虚拟语料库。在python中是一样的吗?或者有没有其他方法可以在python中解决这个问题?

要了解我如何在 R 中解决此问题,请参阅:

Split a huge dataframe in many smaller dataframes to create a corpus in r

How transform a list into a corpus in r?

【问题讨论】:

    标签: python r dataframe virtualization corpus


    【解决方案1】:

    这是你在 R 中的解决方案

    我创建了一个类似的data.frame df

    df <- data.frame(group = rep(1:6, each = 2) , value = 1:12)
    

    这里是未来小型数据帧的组索引和名称

    idx <- unique(df$group)
    nms <- paste0('df', idx)
    

    接下来,在for 循环中,我创建了这些小的data.frames

    for(i in idx){
      df_tmp <- df[df$group == i, ]
      do.call('<-', list(nms[i], df_tmp))
    }
    

    【讨论】:

    • 问题不在于如何在 R 中做到这一点。他们链接到询问如何在 R 中做到这一点的问题,答案是使用split,这是一种更好的方法。
    猜你喜欢
    • 2020-09-03
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2013-05-14
    • 1970-01-01
    • 2020-01-18
    • 2023-02-22
    • 1970-01-01
    相关资源
    最近更新 更多