【发布时间】:2016-10-19 23:27:07
【问题描述】:
我正在研究一个包含对简历进行分类的多类分类问题。
我使用 sklearn 及其 TfIdfVectorizer 获得了一个大的 scipy 稀疏矩阵,我在酸洗后将其输入到 Tensorflow 模型中。在我的本地机器上,我加载它,将小批量转换为密集的 numpy 数组并填充一个提要字典。一切都很好。
现在我想在机器学习云上做同样的事情。我的泡菜存储在gs://my-bucket/path/to/pickle,但是当我运行我的训练器时,在这个URI (IOError: [Errno 2] No such file or directory) 上找不到泡菜文件。我正在使用pickle.load(open('gs://my-bucket/path/to/pickle), 'rb') 来提取我的数据。我怀疑这不是在 GCS 上打开文件的好方法,但我对 Google Cloud 完全陌生,找不到合适的方法。
另外,我读到必须使用 TFRecords 或 CSV 格式输入数据,但我不明白为什么我的方法不起作用。 CSV 被排除在外,因为矩阵的密集表示太大而无法放入内存。 TFRecords 可以像这样有效地编码稀疏数据吗?是否可以从 pickle 文件中读取数据?
【问题讨论】:
标签: google-cloud-ml