【发布时间】:2019-11-08 10:14:19
【问题描述】:
我运行脚本时定义了 ngram_vectorizer = CountVectorizer(binary=True) 和 ngram_vectorizer = CountVectorizer(binary=False)
两者的混淆矩阵的结果是不同的。可以帮助我理解二进制文件的作用吗?
【问题讨论】:
标签: python vector nlp n-gram countvectorizer
我运行脚本时定义了 ngram_vectorizer = CountVectorizer(binary=True) 和 ngram_vectorizer = CountVectorizer(binary=False)
两者的混淆矩阵的结果是不同的。可以帮助我理解二进制文件的作用吗?
【问题讨论】:
标签: python vector nlp n-gram countvectorizer
如果您设置binary=True,则 CountVectorizer 不再使用术语/标记的计数。如果文档中存在令牌,则为 1,如果不存在,则为 0,无论其出现频率如何。所以你将只处理二进制值。默认情况下,binary=False。
【讨论】: