【发布时间】:2019-06-25 15:11:35
【问题描述】:
我在尝试上传预训练的 word2vec 文件时收到错误消息 (用 fasttext 编译)使用 Gensim。文件具有“.vec”扩展名和 可以在这里找到: http://89.38.230.23/word_embeddings/we/corola.300.20.vec.zip
到目前为止我已经尝试过:选项 1:来自 gensim.models 的 KeyedVectors 选项 2:FastText 包装器
#Option 1
from gensim.models import KeyedVectors
model = KeyedVectors.load_word2vec_format('Word_embeddings/corola.300.20.vec', binary=True)
######
#Option 2
from gensim.models.wrappers import FastText
model = FastText.load_word2vec_format('Word_embeddings/corola.300.20.vec')
错误选项 1:UnicodeDecodeError: 'utf-8' codec can't decode byte 位置 0 中的 0x9b:无效的起始字节
弃用错误选项 2:弃用警告:弃用。采用 gensim.models.KeyedVectors.load_word2vec_format 代替。
我需要正确的方法来成功上传word2vec文件, 使用 gensim。
谢谢。
【问题讨论】:
-
哪个类用于训练
corola.300.20.vec.zip文件,它是如何保存的?当您使用同一个类加载文件时会发生什么? (另外:DeprecationWarning不是致命错误。如果您在尝试第二种方法时看到的确实如此,那么您可能仍然有一个工作负载model。)
标签: python nlp gensim word2vec fasttext