【问题标题】:Scikit-learn tfidf vectorizer in minibatches?小批量的 Scikit-learn tfidf 矢量化器?
【发布时间】:2019-06-09 11:43:03
【问题描述】:

我一直在尝试对大型语料库执行 tf-idf 启发式算法。

我可以迭代读取文档,并调用

vectorizer.fit()

在每次迭代中?这是只考虑当前迭代,还是记住以前的迭代?

谢谢!

【问题讨论】:

  • 每次调用 fit 时,词汇表都会从头开始初始化,所以这不是一个选项。
  • 那有什么解决办法?

标签: scikit-learn tf-idf


【解决方案1】:

您的问题的解决方案将取决于您的特定应用程序。您可以考虑 gensim 的 tfidf 实现,它更高效,并且不需要像 this post 解释的那样将整个语料库保存在内存中。

【讨论】:

  • 谢谢!这正是我想要的。
猜你喜欢
  • 2020-05-07
  • 2015-03-02
  • 2018-06-04
  • 2018-04-06
  • 2017-12-11
  • 2015-03-23
  • 2016-04-08
  • 2015-04-15
  • 2017-12-25
相关资源
最近更新 更多