【问题标题】:Unable to run spark-terasort with spark-1.6.1-bin-hadoop1无法使用 spark-1.6.1-bin-hadoop1 运行 spark-terasort
【发布时间】:2016-09-13 19:48:25
【问题描述】:

我正在尝试使用 spark-1.6.1-bin-hadoop1(hadoop 1.X 的预构建包)运行 spark-terasort。

当我尝试运行 spark 时:

./bin/spark-submit --class com.github.ehiggs.spark.terasort.TeraGen  ~/spark-terasort/target/spark-terasort-1.0-jar-with-dependencies.jar 100G hdfs:///input_terasort

我得到错误:

线程“main”java.lang.IncompatibleClassChangeError 中的异常:找到了类 org.apache.hadoop.mapreduce.JobContext,但需要接口

这可能与不同的 Hadoop 版本有关(在 spark 和 spark-terasort 之间)。我尝试过使用 pom.xml(用于编译 spark-terasort),但没有取得多大成功。

如何将 spark-terasort 与 spark-1.6.1-bin-hadoop1 一起使用?

【问题讨论】:

    标签: maven hadoop apache-spark


    【解决方案1】:

    spark-terasort 是旧的:

      <scala.binary.version>2.10</scala.binary.version>
      <spark.version>1.2.1</spark.version>
    

    我正在研究修补它。会回来的。。

    更新我尝试使用1.6.0-SNAPSHOT,TeraGen 运行良好。

    Input size: 1000KB
    Total number of records: 10000
    Number of output partitions: 2
    Number of records/output partition: 5000
    ===========================================================================
    ===========================================================================
    Number of records written: 10000
    

    这是针对 local 文件系统运行时。我将在大约 12 小时后查看 real hdfs。

    【讨论】:

    • 谢谢,我在哪里可以获得 1.6.0-SNAPSHOT 版本的 spark?
    • 哦 - 你应该对 1.6.1 没问题:你的版本比我的稍新。基本上我需要做更多的功课来重现你的问题。到目前为止,我的结果更多地是作为“仅供参考”提供的,以表明 teragen 确实有一些希望。
    猜你喜欢
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2022-08-09
    • 1970-01-01
    • 2020-02-21
    • 1970-01-01
    • 2016-10-29
    相关资源
    最近更新 更多