【问题标题】:Gensim word2vec downsampling sample=0Gensim word2vec 下采样样本=0
【发布时间】:2020-07-11 06:42:13
【问题描述】:

Gensim word2vec 中的sample= 0 是否意味着我的训练期间没有使用下采样?文档就是这么说的

"有用的范围是 (0, 1e-5)"

但是将阈值设置为 0 会导致 P(wi) 等于 1,这意味着不会丢弃任何单词,我是否理解正确?

我正在处理一个包含 7597 个 Facebook 帖子(18945 个字)的相对较小的数据集,我的嵌入在使用 sample= 0 而不是推荐范围内的任何其他内容时表现得更好。有什么特别的原因吗?字体大小?

【问题讨论】:

    标签: python math gensim word-embedding subsampling


    【解决方案1】:

    对于Word2Vec 训练来说,这似乎是一个非常小的数据集。 (那是只有 18945 个独特的词,还是总共 18945 个词,所以每个帖子几乎不超过 2 个词?)

    采样在较大的数据集上最有用 - 有 这么多 个常用词的示例,更多的训练示例并没有增加太多 - 但他们正在从这些词中窃取时间,并过度使用这些词' 与其他不太常见的词相比。

    是的,sample=0 表示没有下采样。

    【讨论】:

    • 18945 个唯一词。我正在攻读博士学位(数字人文学科),研究定性研究中的词嵌入应用,它们实际上在这种规模的小型数据集上也表现得很好,至少对于我的研究目标而言。在这种情况下,目标是对数据和我的假设进行第一次实验探索。然而,作为一名语言学家,我认为比例不会有太大变化,因为文章和命题不会在我的上下文中添加任何语义信息,但是使用不下采样输出准确向量,而使用它输出非常稀疏和“嘈杂”向量
    • 有趣!如果您在INFO 级别启用日志记录,一些输出将指示您的sample 值对实际训练字数的影响程度。我想一些单词分布或其他参数/​​数据贡献(可能是一个小的window 和许多微小的训练单个文本,每个文本都有很多下采样的常用词?)可能会从sample 产生巨大的影响。而是默认值。 1e-03,应该有这样一个温和的效果 - 日志输出将显示更多关于有多少单词受到它的影响。
    猜你喜欢
    • 2020-03-19
    • 1970-01-01
    • 2020-03-05
    • 2023-03-18
    • 2016-09-02
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2016-02-14
    相关资源
    最近更新 更多