【发布时间】:2017-07-10 19:39:10
【问题描述】:
我有一组文档IDs (keys.csv),用于从文档源获取一组文本文档。我想将所有这些文本文档收集到一个语料库中以进行进一步分析(如余弦相似度)。
我正在使用以下代码将每个文本文档附加到语料库中,但我不确定这是否可行。有没有更好的方法来使用这些文本文档创建语料库?
keys = pandas.read_csv(keys.csv)
for i in keys:
ID = i
doc = function_to_get_document(ID)
corpus = corpus.append(doc)
【问题讨论】:
-
corpus是一个列表吧? -
最好的答案是测试它,看看它是否符合您的目的。更何况,你的
ID变量没用。 -
可能类似于
corpus = [function_to_get_document(ID) for ID in pandas.read_csv(keys.csv)]? -
没有。您不要将
corpus.append的结果分配回corpus,因为corpus.append总是 返回None。你只需要corpus.append(doc) -
这里的
corpus是什么意思?
标签: python pandas scikit-learn nlp corpus