【问题标题】:How to run a spark example program in Intellij IDEA如何在 Intellij IDEA 中运行 spark 示例程序
【发布时间】:2014-02-22 07:32:08
【问题描述】:

首先在命令行上从我下载的 spark 项目的根目录运行

mvn package

成功了。

然后通过导入 spark pom.xml 创建了一个 intellij 项目。

在 IDE 中,示例类看起来很好:找到了所有库。这可以在屏幕截图中查看。

但是,当尝试运行 main() 时,会在 SparkContext 上发生 ClassNotFoundException。

为什么 Intellij 不能简单地加载和运行这个基于 maven 的 scala 程序?有什么办法可以解决?

如下所示,SparkContext 在 IDE 中看起来很好:但在尝试运行时找不到:

测试是通过右键单击 main() 内部运行的:

.. 并选择运行 GroupByTest

它给了

Exception in thread "main" java.lang.NoClassDefFoundError: org/apache/spark/SparkContext
    at org.apache.spark.examples.GroupByTest$.main(GroupByTest.scala:36)
    at org.apache.spark.examples.GroupByTest.main(GroupByTest.scala)
    at sun.reflect.NativeMethodAccessorImpl.invoke0(Native Method)
    at sun.reflect.NativeMethodAccessorImpl.invoke(NativeMethodAccessorImpl.java:57)
    at sun.reflect.DelegatingMethodAccessorImpl.invoke(DelegatingMethodAccessorImpl.java:43)
    at java.lang.reflect.Method.invoke(Method.java:606)
    at com.intellij.rt.execution.application.AppMain.main(AppMain.java:120)
Caused by: java.lang.ClassNotFoundException: org.apache.spark.SparkContext
    at java.net.URLClassLoader$1.run(URLClassLoader.java:366)
    at java.net.URLClassLoader$1.run(URLClassLoader.java:355)
    at java.security.AccessController.doPrivileged(Native Method)
    at java.net.URLClassLoader.findClass(URLClassLoader.java:354)
    at java.lang.ClassLoader.loadClass(ClassLoader.java:424)
    at sun.misc.Launcher$AppClassLoader.loadClass(Launcher.java:308)
    at java.lang.ClassLoader.loadClass(ClassLoader.java:357)
    ... 7 more

这里是运行配置:

【问题讨论】:

    标签: scala intellij-idea apache-spark


    【解决方案1】:

    Spark lib 不是您的 class_path。

    执行sbt/sbt assembly

    在你的项目中包含“/assembly/target/scala-$SCALA_VERSION/spark-assembly*hadoop*-deps.jar”。

    【讨论】:

    • 如果 spark-lib 不在类路径中,那么为什么会在 IDE 中找到它? IDE 中没有错误。注意 JVM 的类路径正在使用模块类路径。
    • 好的,这样就完成了。所以显然运行 mvn package 是不够的
    【解决方案2】:

    这可能对IntelliJ-Runtime-error-tt11383 有所帮助。将模块依赖项从 provide 更改为 compile。这对我有用。

    【讨论】:

    • 这是一个旧线程 - 问题可能不再相同。但它仍然是一个有用的提示,可以包含在故障排除工具箱中。
    【解决方案3】:

    您需要添加 spark 依赖项。如果您使用的是 maven,只需将这些行添加到您的 pom.xml:

    <dependencies>
        ...
        <dependency>
            <groupId>org.apache.spark</groupId>
            <artifactId>spark-core_${scala.binary.version}</artifactId>
            <version>${spark.version}</version>
            <scope>provided</scope>
        </dependency>
        ...
    </dependencies>
    

    这样,您将拥有用于编译和测试目的的依赖项,但不会出现在“jar-with-dependencies”工件中。

    但是,如果您想在 intellij 中运行的独立集群中执行整个应用程序,您可以添加一个 maven 配置文件以添加具有编译范围的依赖项。就像这样:

    <properties>
        <scala.binary.version>2.11</scala.binary.version>
        <spark.version>1.2.1</spark.version>
        <spark.scope>provided</spark.scope>
    </properties>
    
    <profiles>
        <profile>
            <id>local</id>
            <properties>
                <spark.scope>compile</spark.scope>
            </properties>
            <dependencies>
                <!--<dependency>-->
                    <!--<groupId>org.apache.hadoop</groupId>-->
                    <!--<artifactId>hadoop-common</artifactId>-->
                    <!--<version>2.6.0</version>-->
                <!--</dependency>-->
                <!--<dependency>-->
                    <!--<groupId>com.hadoop.gplcompression</groupId>-->
                    <!--<artifactId>hadoop-gpl-compression</artifactId>-->
                    <!--<version>0.1.0</version>-->
                <!--</dependency>-->
                <dependency>
                    <groupId>com.hadoop.gplcompression</groupId>
                    <artifactId>hadoop-lzo</artifactId>
                    <version>0.4.19</version>
                </dependency>
            </dependencies>
            <activation>
                <activeByDefault>false</activeByDefault>
                <property>
                    <name>env</name>
                    <value>local</value>
                </property>
            </activation>
        </profile>
    </profiles>
    
    <dependencies>
        <!-- SPARK DEPENDENCIES -->
        <dependency>
            <groupId>org.apache.spark</groupId>
            <artifactId>spark-core_${scala.binary.version}</artifactId>
            <version>${spark.version}</version>
            <scope>${spark.scope}</scope>
        </dependency>
    </dependencies>
    

    我还向我的应用程序添加了一个选项,以在 --local 被传递时启动本地集群:

      private def sparkContext(appName: String, isLocal:Boolean): SparkContext = {
          val sparkConf = new SparkConf().setAppName(appName)
          if (isLocal) {
              sparkConf.setMaster("local")
          }
          new SparkContext(sparkConf)
      }
    

    最后,您必须在 Intellij 中启用“本地”配置文件才能获得正确的依赖关系。只需转到“Maven 项目”选项卡并启用配置文件。

    【讨论】:

    • 我的 spark 代码库快用完了,所以不是要添加 spark 依赖项。
    猜你喜欢
    • 2016-07-12
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2019-05-09
    • 2022-11-23
    • 2023-03-07
    • 1970-01-01
    相关资源
    最近更新 更多