【问题标题】:What method should I use to convert words into features for Machine Learning applications? [closed]我应该使用什么方法将单词转换为机器学习应用程序的特征? [关闭]
【发布时间】:2017-06-11 22:32:22
【问题描述】:

我正计划构建一个性别分类器。我知道两个流行的模型是 tf-idf 和 word2vec。 tf-idf 侧重于单词在文档中的重要性和文档的相似性,而 word2vec 更侧重于单词之间的关系以及它们之间的相似性。

但是,似乎没有一个主题非常适合构建用于性别分类的矢量特征。是否有其他可能适合此任务的替代矢量化模型?

【问题讨论】:

    标签: python nlp tf-idf word2vec


    【解决方案1】:

    是的,w2v 还有另一种选择:GloVe

    GloVe 代表全局向量嵌入。 作为以前使用过这种技术并取得良好效果的人,我会推荐 GloVe。

    GloVe 不仅通过查看局部窗口而且考虑更大的宽度(30+ 大小)来优化训练神经词嵌入,从而将更深层次的语义嵌入到嵌入中。

    使用 glove,可以很容易地对关系建模,例如:X[man] - X[woman] = X[king] - X[queen],其中这些都是向量。

    致谢:GloVe GitHub 页面(链接如下)。

    您可以训练自己的 GloVe 嵌入,也可以使用他们重新训练的可用模型。即使对于特定领域,通用模型似乎也能很好地工作,尽管如果你自己训练它们,你会从模型中得到更多。请查看 GitHub 页面以获取有关如何训练自己的模型的说明。这很容易。

    补充阅读:

    【讨论】:

    • 一个问题。 GloVe 是否支持印地语?是否有任何预训练模型包含印地语数据?
    • @Djokester 如果你说的是用英语写的印地语,那么我相信它会支持这一点。但是,实际的印地语脚本?不能说。我以前从未尝试过。值得一试。此外,据我所知,不存在预训练的印地语模型。
    • 是否有用于 GloVe 的 Python 包?我没有遇到可靠的。
    • 这里是one,但除了原版我不会发誓。
    • 酷。一切顺利。
    猜你喜欢
    • 2014-04-09
    • 2021-11-18
    • 2011-11-22
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2011-01-10
    相关资源
    最近更新 更多