【问题标题】:How to create a corpus with a set of text files - python?如何使用一组文本文件创建语料库 - python?
【发布时间】:2017-07-10 19:39:10
【问题描述】:

我有一组文档IDs (keys.csv),用于从文档源获取一组文本文档。我想将所有这些文本文档收集到一个语料库中以进行进一步分析(如余弦相似度)。

我正在使用以下代码将每个文本文档附加到语料库中,但我不确定这是否可行。有没有更好的方法来使用这些文本文档创建语料库?

keys = pandas.read_csv(keys.csv)
for i in keys:
    ID = i
    doc = function_to_get_document(ID)
    corpus = corpus.append(doc)

【问题讨论】:

  • corpus 是一个列表吧?
  • 最好的答案是测试它,看看它是否符合您的目的。更何况,你的 ID 变量没用。
  • 可能类似于corpus = [function_to_get_document(ID) for ID in pandas.read_csv(keys.csv)]
  • 没有。您不要将corpus.append 的结果分配回corpus,因为corpus.append 总是 返回None。你只需要corpus.append(doc)
  • 这里的corpus 是什么意思?

标签: python pandas scikit-learn nlp corpus


【解决方案1】:

如果csv 的列IDcol 具有唯一的ID 使用list comprehension,则输出为list

corpus = [function_to_get_document(ID) for ID in pd.read_csv('keys.csv')['IDcol']]

示例:

print (pd.read_csv('keys.csv'))
   IDcol
0      1
1      2
2      3

def function_to_get_document(x):
    return x + 1

corpus = [function_to_get_document(ID) for ID in pd.read_csv('keys.csv')['IDcol']]
print (corpus)
[2, 3, 4]

【讨论】:

    猜你喜欢
    • 1970-01-01
    • 2016-03-17
    • 1970-01-01
    • 1970-01-01
    • 2021-10-15
    • 2019-07-17
    • 2016-09-22
    • 2019-12-14
    • 2018-08-04
    相关资源
    最近更新 更多