【问题标题】:Input data to AWS Elastic Search using Glue使用 Glue 向 AWS Elastic Search 输入数据
【发布时间】:2020-10-30 22:19:02
【问题描述】:

我正在寻找一种使用 AWS Glue python 或 pyspark 将数据插入 AWS Elastic Search 的解决方案。我见过 Boto3 SDK for Elastic Search,但找不到将数据插入 Elastic Search 的任何函数。谁能帮我找到解决方案? 任何有用的链接或代码?

【问题讨论】:

    标签: amazon-web-services apache-spark pyspark aws-glue aws-elasticsearch


    【解决方案1】:

    对于 aws 胶水,您需要在作业中添加一个额外的 jar。

    1. https://repo1.maven.org/maven2/org/elasticsearch/elasticsearch-hadoop/7.8.0/elasticsearch-hadoop-7.8.0.jar下载jar
    2. 将 jar 保存在 s3 上并将其传递给粘合作业。
    3. 现在在保存数据框时使用以下
    df.write.format("org.elasticsearch.spark.sql").\
             option("es.resource", "index/document").\
             option("es.nodes", host).\
             option("es.port", port).\
             save()
    

    如果您使用的是 aws 托管弹性搜索,请尝试将其设置为 true

    option("es.nodes.wan.only", "true")
    

    更多属性请查看https://www.elastic.co/guide/en/elasticsearch/hadoop/current/configuration.html

    注意 elasticsearch-spark 连接器仅与 spark 2.3 兼容,因为它是在 scala 2.11 上预构建的,而 spark 2.4 和 spark 3.0 是在 scala 2.12 上预构建的

    【讨论】:

    • 但我使用的是 spark 2.4
    猜你喜欢
    • 1970-01-01
    • 1970-01-01
    • 2018-02-16
    • 2019-02-18
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多