【问题标题】:How to perform LSA on a huge dataset that does not fit into memory with Python?如何使用 Python 在不适合内存的巨大数据集上执行 LSA?
【发布时间】:2020-08-19 20:38:27
【问题描述】:

我之前也有类似的问题,但我还没有找到适合我的解决方案。所以我有一百万个文档,假设每个文档大约有 20-30 个单词。我想进行词形还原,删除停用词并使用 100,000 个单词来构建一个 tf-idf 矩阵,然后对其进行 SVD。 我怎样才能在合理的时间内使用 Python 做到这一点并且不会遇到内存错误?

如果有人有任何想法,那就太好了。

【问题讨论】:

    标签: python nlp artificial-intelligence


    【解决方案1】:

    有一种算法叫做SPIMI(single-pass-in-memroy-indexing)。它基本上涉及每次内存不足时遍历数据并写入磁盘,然后将所有磁盘保存合并到一个大矩阵中。 我已经为一个项目实现了这个here

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 2014-05-20
      • 2016-01-01
      • 1970-01-01
      • 1970-01-01
      相关资源
      最近更新 更多