【问题标题】:How to install offline Spark NLP packages如何安装离线 Spark NLP 包
【发布时间】:2020-12-06 07:43:19
【问题描述】:

如何在没有互联网连接的情况下安装离线 Spark NLP 包。 我已经下载了包(recognizee_entities_dl)并上传到集群。

我已经使用pip install spark-nlp==2.5.5 安装了 Spark NLP。 我正在使用 PySpark,但无法从集群下载软件包。

已经试过了;

pipeline = PretrainedPipeLine.from_disk('/path/to/recognize_entities_dl')
pipeline = PretrainedPipeLine.load('/path/to/recognize_entities_dl')

错误:

'PretrainedPipeline' has no attribute 'load'

Input path does not exist:
    hdfs://...../recognize_entities_dl_en_2.4.3_2.4_1584626752821/metatdata

【问题讨论】:

  • 请添加更多详细信息,无论您使用的是 Scala Spark 还是 Pyspark?如果您使用的是 pyspark,则始终可以在每个节点上启动应用程序之前使用 pip install package_name_downloaded。理想情况下,您应该在创建集群时安装,通过 docker 镜像安装是另一种选择
  • 那么,您已经安装了所有东西,但是无法从磁盘加载预训练的识别实体模型?你有什么错误吗?
  • 您使用的是什么 Spark 版本?此外,您可以使用hdfs dfs -ls /path/to/... 检查文件是否存在。
  • 为什么要加载模型?因为您的 Apache Spark 版本
  • stackoverflow.com/questions/58522742/… - 这可能对你有帮助

标签: apache-spark pyspark johnsnowlabs-spark-nlp


【解决方案1】:

查看您的错误:

 hdfs://...../recognize_entities_dl_en_2.4.3_2.4_1584626752821/metatdata

元数据您应该通过删除一个额外的“t”来更改为元数据。

另外,您会在“recognize_entities_dl_en_2.4.3_2.4_1584626752821”中看到 2.4.3

这表示它适用于 Spark NLP 2.4.3

但是,在问题中,您提到您正在使用,

spark-nlp==2.5.5

只要是这样就可以了

2.5.5 >= 2.4.3

但有时它会导致问题。

还有 2.4 在“recognize_entities_dl_en_2.4.3_2.4_1584626752821”

这表示它适用于 Apache Spark 2.4

针对 Apache Spark 2.4.x 构建和编译的 Spark NLP 库。这就是模型和管道仅适用于 2.4.x 版本的原因。

【讨论】:

    猜你喜欢
    • 2012-06-20
    • 1970-01-01
    • 1970-01-01
    • 2015-08-10
    相关资源
    最近更新 更多