【发布时间】:2018-07-02 09:41:52
【问题描述】:
我正在尝试创建一个 gensim 语料库并将其保存到任意 HDFS 或常规 FS 路径。我正在使用 pyspark (2.2.1) 并在 hadoop 集群上运行 zeppelin 笔记本。这是我的最小示例:
from gensim import corpora
import os
path = "/my/existing/hadoop/path"
corpus = [[(0,0), (1,2)]]
corpora.MmCorpus.serialize(os.path.join(path,"corpus.mm"), corpus)
这会导致错误:
[Errno 2] No such file or directory: '/my/existing/hadoop/path/corpus.mm'
虽然路径存在。
运行以下工作。
corpora.MmCorpus.serialize("corpus.mm", corpus)
corpora.MmCorpus.serialize(os.path.join("/tmp","corpus.mm"), corpus)
但是,我找不到它。我检查了/tmp 和hadoop fs -ls /tmp
使用 pyspark 时需要什么样的路径?
【问题讨论】:
标签: hadoop serialization pyspark gensim apache-zeppelin