【问题标题】:How to read data from Amazon QLDB using Spark and Scala/PySpark?如何使用 Spark 和 Scala/PySpark 从 Amazon QLDB 读取数据?
【发布时间】:2020-04-14 14:23:38
【问题描述】:

我正在尝试创建自定义 ETL 数据管道。我使用 Amazon QLDB 作为我的来源。但我不知道如何使用 Spark-Scala 或 Spark-Python 从 Amazon QLDB 读取数据。

QLDB 文档提供来自以下链接的驱动程序依赖项。

https://docs.aws.amazon.com/qldb/latest/developerguide/getting-started-driver.html

谁能帮帮我。提前致谢。

【问题讨论】:

  • 您分享的链接包含如何将 QLDB 与 Java/Scala 和 Python 一起使用的分步指南。您希望在这里得到什么答案?
  • @nickolay.laptev 嗨,我需要使用 spark 从 QLDB 中提取数据。但是 spark 没有提供任何用于创建数据框的 qldb 格式选项。我是这个 ETL 的新手,所以我也有点困惑。
  • 您有为此编写的任何代码吗?这将有助于人们更好地回答。

标签: scala amazon-web-services apache-spark pyspark amazon-qldb


【解决方案1】:

从 QLDB Python 文档中,您可以通过以下方式从 QLDB 中读取数据:

def read_documents(transaction_executor):
    cursor = transaction_executor.execute_statement("SELECT * FROM Person WHERE GovId = 'TOYENC486FH'")

    for doc in cursor:
        print(doc["GovId"]) # prints TOYENC486FH
        print(doc["FirstName"]) # prints Brent

qldb_driver.execute_lambda(lambda executor: read_documents(executor))

这是否告诉您从 QLDB 读取需要做什么?

【讨论】:

    猜你喜欢
    • 2021-06-14
    • 1970-01-01
    • 2015-08-04
    • 2017-10-03
    • 2020-02-04
    • 2019-09-08
    • 2018-05-04
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多