【发布时间】:2019-09-19 15:34:51
【问题描述】:
我想使用 R 中的 rword2vec 包在我自己的语料库上训练 word2vec 模型。
用于训练模型的word2vec 函数需要train_file。 R 中的包文档仅指出这是训练文本数据,但没有指定如何创建它。
GitHub上示例中使用的训练数据可以在这里下载: http://mattmahoney.net/dc/text8.zip。我无法弄清楚它是什么类型的文件。
我查看了rword2vec GitHub page 上的 README 文件,并查看了Google Code 上的官方 word2vec 页面。
我的语料库是一个 .csv 文件,包含大约 68,000 个文档。文件大小约为 300MB。我意识到在这种规模的语料库上训练模型可能需要很长时间(或不可行),但我愿意在语料库的一个子集上训练它。我只是不知道如何创建函数所需的train_file。
【问题讨论】:
标签: r word2vec word-embedding natural-language-processing