【发布时间】:2020-12-06 07:43:19
【问题描述】:
如何在没有互联网连接的情况下安装离线 Spark NLP 包。
我已经下载了包(recognizee_entities_dl)并上传到集群。
我已经使用pip install spark-nlp==2.5.5 安装了 Spark NLP。
我正在使用 PySpark,但无法从集群下载软件包。
已经试过了;
pipeline = PretrainedPipeLine.from_disk('/path/to/recognize_entities_dl')
pipeline = PretrainedPipeLine.load('/path/to/recognize_entities_dl')
错误:
'PretrainedPipeline' has no attribute 'load'
Input path does not exist:
hdfs://...../recognize_entities_dl_en_2.4.3_2.4_1584626752821/metatdata
【问题讨论】:
-
请添加更多详细信息,无论您使用的是 Scala Spark 还是 Pyspark?如果您使用的是 pyspark,则始终可以在每个节点上启动应用程序之前使用 pip install package_name_downloaded。理想情况下,您应该在创建集群时安装,通过 docker 镜像安装是另一种选择
-
那么,您已经安装了所有东西,但是无法从磁盘加载预训练的识别实体模型?你有什么错误吗?
-
您使用的是什么 Spark 版本?此外,您可以使用
hdfs dfs -ls /path/to/...检查文件是否存在。 -
为什么要加载模型?因为您的 Apache Spark 版本
-
stackoverflow.com/questions/58522742/… - 这可能对你有帮助
标签: apache-spark pyspark johnsnowlabs-spark-nlp