【发布时间】:2020-07-11 06:42:13
【问题描述】:
Gensim word2vec 中的sample= 0 是否意味着我的训练期间没有使用下采样?文档就是这么说的
"有用的范围是 (0, 1e-5)"
但是将阈值设置为 0 会导致 P(wi) 等于 1,这意味着不会丢弃任何单词,我是否理解正确?
我正在处理一个包含 7597 个 Facebook 帖子(18945 个字)的相对较小的数据集,我的嵌入在使用 sample= 0 而不是推荐范围内的任何其他内容时表现得更好。有什么特别的原因吗?字体大小?
【问题讨论】:
标签: python math gensim word-embedding subsampling