【发布时间】:2017-08-22 05:15:15
【问题描述】:
我一直在尝试关注博客文章:
https://www.phdata.io/exploring-spark-mllib-part-4-exporting-the-model-for-use-outside-of-spark/
使用内置 Hadoop 2.7 的 spark 2.1 在本地运行我可以保存模型:
trainedModel.save("mymodel.model"))
但是,如果我尝试从常规 scala (sbt) shell 加载模型,hdfs 将无法加载。
import org.apache.spark.SparkConf
import org.apache.spark.SparkContext
import org.apache.spark.ml.{PipelineModel, Predictor}
val sc = new SparkContext(new SparkConf().setMaster("local[1]").setAppName("myApp"))
val model = PipelineModel.load("mymodel.model")
我知道这是错误:
java.util.ServiceConfigurationError: org.apache.hadoop.fs.FileSystem: Provider org.apache.hadoop.hdfs.DistributedFileSystem could not be instantiated
实际上是否可以在不调用 spark-submit 或 spark-shell 的情况下使用 spark 模型?我链接到的文章是我见过的唯一一篇提到此类功能的文章。
我的 build.sbt 正在使用以下依赖项:
"org.apache.spark" %% "spark-core" % "2.1.0",
"org.apache.spark" % "spark-sql_2.11" % "2.1.0",
"org.apache.spark" % "spark-hive_2.11" % "2.1.0",
"org.apache.spark" % "spark-mllib_2.11" % "2.1.0",
"org.apache.hadoop" % "hadoop-hdfs" % "2.7.0"
在这两种情况下,我都使用 Scala 2.11.8。
编辑:好的,看起来这是问题的根源
"org.apache.hadoop" % "hadoop-hdfs" % "2.7.0"
我删除了那行,问题就消失了
【问题讨论】:
标签: scala apache-spark hdfs apache-spark-ml