【问题标题】:Create empty Corpus in textacy在 textacy 中创建空的语料库
【发布时间】:2020-03-18 13:03:09
【问题描述】:

我想在 textacy 中创建一个空的语料库,然后通过

用数据填充它
corpus.add(doc)

但每次我尝试创建一个空的语料库时,我都无法保存它,而是出现此错误:

IndexError: list index out of range

我尝试在创建语料库时不提供任何数据或不提供任何数据:

corpus = textacy.Corpus(lang=locale)
corpus = textacy.Corpus(lang=locale, data=None)
corpus.save(path) # this line results in the index error

如果有人可以帮助我,那就太好了:)

【问题讨论】:

    标签: python nlp spacy textacy


    【解决方案1】:

    我自己也试过了。 locale 到底是什么?我执行了以下操作:

    1. 为德语创建了 spacy 语言对象

    nlp = spacy.load("de_core_news_lg")

    1. 然后将其传递给

    corpus = textacy.Corpus(nlp)

    之后,我能够遍历我的文档并为每个项目添加项目。

    但是,我不建议这样做。我已经执行了两个场景来处理 15k 短 cmets:

    • 我首先将我的文档预处理为一个列表,并将其直接放入textacy.Corpus(nlp, data=preprocessed_list)。这把我带到了22 s
    • 执行相同的逻辑,但通过创建一个空语料库并将每个项目添加到其中持续 1 min 26 s

    【讨论】:

      猜你喜欢
      • 2018-05-25
      • 1970-01-01
      • 1970-01-01
      • 2011-05-15
      • 1970-01-01
      • 2011-06-27
      • 2013-05-14
      相关资源
      最近更新 更多