【发布时间】:2022-01-23 05:00:05
【问题描述】:
我在运行 gensim 以创建字典和文档术语矩阵时遇到问题。
当我跑步时:
from gensim import corpora, models
import gensim
clean = ['door', 'cat', 'mom']
dictionary = corpora.Dictionary(clean)
我明白了:
doc2bow expects an array of unicode tokens on input, not a single string
在真正的问题中,Clean 仍然是一个列表类型的变量。在应用了分词器、标注器、删除标点符号等之后,就是一个大型语料库中的所有单词。
为什么会出现这个错误?
【问题讨论】:
标签: python machine-learning nlp gensim corpus