【发布时间】:2020-08-19 20:38:27
【问题描述】:
我之前也有类似的问题,但我还没有找到适合我的解决方案。所以我有一百万个文档,假设每个文档大约有 20-30 个单词。我想进行词形还原,删除停用词并使用 100,000 个单词来构建一个 tf-idf 矩阵,然后对其进行 SVD。 我怎样才能在合理的时间内使用 Python 做到这一点并且不会遇到内存错误?
如果有人有任何想法,那就太好了。
【问题讨论】:
标签: python nlp artificial-intelligence