【问题标题】:Word2Vec: Error received at uploading a pre-trained word2vec file using GensimWord2Vec:使用 Gensim 上传预训练的 word2vec 文件时收到错误
【发布时间】:2019-06-25 15:11:35
【问题描述】:

我在尝试上传预训练的 word2vec 文件时收到错误消息 (用 fasttext 编译)使用 Gensim。文件具有“.vec”扩展名和 可以在这里找到: http://89.38.230.23/word_embeddings/we/corola.300.20.vec.zip

到目前为止我已经尝试过:选项 1:来自 gensim.models 的 KeyedVectors 选项 2:FastText 包装器

#Option 1
    from gensim.models import KeyedVectors
    model = KeyedVectors.load_word2vec_format('Word_embeddings/corola.300.20.vec', binary=True)
######

#Option 2
    from gensim.models.wrappers import FastText
    model = FastText.load_word2vec_format('Word_embeddings/corola.300.20.vec')

错误选项 1:UnicodeDecodeError: 'utf-8' codec can't decode byte 位置 0 中的 0x9b:无效的起始字节

弃用错误选项 2:弃用警告:弃用。采用 gensim.models.KeyedVectors.load_word2vec_format 代替。

我需要正确的方法来成功上传word2vec文件, 使用 gensim。

谢谢。

【问题讨论】:

  • 哪个类用于训练corola.300.20.vec.zip 文件,它是如何保存的?当您使用同一个类加载文件时会发生什么? (另外:DeprecationWarning 不是致命错误。如果您在尝试第二种方法时看到的确实如此,那么您可能仍然有一个工作负载 model。)

标签: python nlp gensim word2vec fasttext


【解决方案1】:

有时,使用unicode_errors='ignore' 参数就可以了,因为单词嵌入文件中可能存在错误。试试看:

model = KeyedVectors.load_word2vec_format('Word_embeddings/corola.300.20.vec', binary=True, unicode_errors='ignore')

【讨论】:

    猜你喜欢
    • 1970-01-01
    • 1970-01-01
    • 2019-02-07
    • 1970-01-01
    • 2019-09-05
    • 2022-01-03
    • 2015-06-17
    • 1970-01-01
    • 2020-06-02
    相关资源
    最近更新 更多