【问题标题】:Mahout LDA gives FileNotFound exceptionMahout LDA 给出 FileNotFound 异常
【发布时间】:2011-11-10 16:45:21
【问题描述】:

我按照here 的说明创建了术语向量,如下所示:

~/Scripts/Mahout/trunk/bin/mahout seqdirectory --input /home/ben/Scripts/eipi/files --output /home/ben/Scripts/eipi/mahout_out -chunk 1
~/Scripts/Mahout/trunk/bin/mahout seq2sparse -i /home/ben/Scripts/eipi/mahout_out -o /home/ben/Scripts/eipi/termvecs -wt tf -seq

然后我运行

~/Scripts/Mahout/trunk/bin/mahout lda -i /home/ben/Scripts/eipi/termvecs -o /home/ben/Scripts/eipi/lda_working -k 2 -v 100

我得到:

MAHOUT-JOB:/home/ben/Scripts/Mahout/trunk/examples/target/mahout-examples-0.6-SNAPSHOT-job.jar 11/09/04 16:28:59 INFO common.AbstractJob:命令行参数:{--endPhase=2147483647,--input=/home/ben/Scripts/eipi/termvecs,--maxIter=-1,-- numTopics=2,--numWords=100,--output=/home/ben/Scripts/eipi/lda_working,--startPhase=0,--tempDir=temp,--topicSmoothing=-1.0} 2004 年 11 月 9 日 16:29:00 信息 lda.LDADriver:LDA 迭代 1 11/09/04 16:29:01 INFO input.FileInputFormat:要处理的总输入路径:4 11/09/04 16:29:01 INFO mapred.JobClient:清理暂存区文件:/tmp/hadoop-ben/mapred/staging/ben692167368/.staging/job_local_0001 线程“主”java.io.FileNotFoundException 中的异常:文件文件:/home/ben/Scripts/eipi/termvecs/tokenized-documents/data 不存在。 在 org.apache.hadoop.fs.RawLocalFileSystem.getFileStatus(RawLocalFileSystem.java:371) 在 org.apache.hadoop.fs.FilterFileSystem.getFileStatus(FilterFileSystem.java:245) 在 org.apache.hadoop.mapreduce.lib.input.SequenceFileInputFormat.listStatus(SequenceFileInputFormat.java:63) 在 org.apache.hadoop.mapreduce.lib.input.FileInputFormat.getSplits(FileInputFormat.java:252) 在 org.apache.hadoop.mapred.JobClient.writeNewSplits(JobClient.java:902) 在 org.apache.hadoop.mapred.JobClient.writeSplits(JobClient.java:919) 在 org.apache.hadoop.mapred.JobClient.access$500(JobClient.java:170) 在 org.apache.hadoop.mapred.JobClient$2.run(JobClient.java:838) 在 org.apache.hadoop.mapred.JobClient$2.run(JobClient.java:791) 在 java.security.AccessController.doPrivileged(本机方法) 在 javax.security.auth.Subject.doAs(Subject.java:396) 在 org.apache.hadoop.security.UserGroupInformation.doAs(UserGroupInformation.java:1059) 在 org.apache.hadoop.mapred.JobClient.submitJobInternal(JobClient.java:791) 在 org.apache.hadoop.mapreduce.Job.submit(Job.java:465) 在 org.apache.hadoop.mapreduce.Job.waitForCompletion(Job.java:494) 在 org.apache.mahout.clustering.lda.LDADriver.runIteration(LDADriver.java:426) 在 org.apache.mahout.clustering.lda.LDADriver.run(LDADriver.java:226) 在 org.apache.mahout.clustering.lda.LDADriver.run(LDADriver.java:174) 在 org.apache.hadoop.util.ToolRunner.run(ToolRunner.java:65) 在 org.apache.mahout.clustering.lda.LDADriver.main(LDADriver.java:90) 在 sun.reflect.NativeMethodAccessorImpl.invoke0(Native Method) 在 sun.reflect.NativeMethodAccessorImpl.invoke(NativeMethodAccessorImpl.java:39) 在 sun.reflect.DelegatingMethodAccessorImpl.invoke(DelegatingMethodAccessorImpl.java:25) 在 java.lang.reflect.Method.invoke(Method.java:597) 在 org.apache.hadoop.util.ProgramDriver$ProgramDescription.invoke(ProgramDriver.java:68) 在 org.apache.hadoop.util.ProgramDriver.driver(ProgramDriver.java:139) 在 org.apache.mahout.driver.MahoutDriver.main(MahoutDriver.java:188) 在 sun.reflect.NativeMethodAccessorImpl.invoke0(Native Method) 在 sun.reflect.NativeMethodAccessorImpl.invoke(NativeMethodAccessorImpl.java:39) 在 sun.reflect.DelegatingMethodAccessorImpl.invoke(DelegatingMethodAccessorImpl.java:25) 在 java.lang.reflect.Method.invoke(Method.java:597) 在 org.apache.hadoop.util.RunJar.main(RunJar.java:156)

没错,那个文件不存在。我应该如何创建它?

【问题讨论】:

    标签: hadoop mahout lda


    【解决方案1】:

    向量可能是空的,因为它们的创建可能存在问题。检查您的矢量是否在其文件夹中成功创建(文件大小不为 0 字节)。如果您的输入文件夹缺少某些文件,则可能会发生此错误。在这种情况下,这两个步骤将起作用,但不会创建有效的输出。

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 2012-06-28
      • 1970-01-01
      • 2020-04-15
      • 1970-01-01
      • 2011-05-10
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      相关资源
      最近更新 更多