【发布时间】:2014-03-31 13:10:08
【问题描述】:
我的问题是当 Mahout 期望输入 DataModel 时,将数据从 Amazon S3 提供给 Mahout。
我正在尝试运行一个 Mahout 应用程序,它基本上只是做简单的推荐
new PearsonCorrelationSimilarity(DataModel);
只要我使用常规文件系统,我就可以让它工作,并且我可以使用以下方式从 Amazon S3 读取内容:
FileSystem fs = FileSystem.get(URI.create("s3n://mybucket"), conf);
FSDataInputStream userPreferencesFile = fs.open(new Path("path/to/my/file"));
但是我给我的是一个流,PearsonCorrelationSimilarity(DataModel) 期望的是 Mahout dataModel,它应该是用文件备份的。
- 我可以让推荐器在本地 fs 上工作。
- 我可以读取 hdfs 或 S3。
- 我不知道如何将 hdfs 流转换成可以输入 dataModel 的东西。
我认为这背后有一些我看不到的非常简单的东西,因为我对 Java 非常缺乏经验。
【问题讨论】: