【问题标题】:appending to a file in azure data lake using data factory使用数据工厂附加到 azure 数据湖中的文件
【发布时间】:2021-06-22 13:03:16
【问题描述】:

我在使用数据工厂将数据附加到 azure 数据湖中的文件时遇到问题。 我正在尝试从 MS Graph API 获取数据,并且我能够获取数据并将其复制用于单个 API 调用,在其中我使用“复制数据”功能将响应推送到数据湖,但如果我想进行多次调用我在哪里得到响应,然后将这些响应附加到一个文件中,我不知道该怎么做。我认为“复制数据”活动不适合它。

一个例子: 获取租户中所有组的 API:

https://graph.microsoft.com/v1.0/Groups/

获取与组关联的所有成员的 API:

https://graph.microsoft.com/v1.0/groups/"GroupID"/owners

“组 ID”来自顶级 API 调用。**

我能够建立一个循环并正确地进行调用。 它只是在我不知所措的地方附加第二次通话的结果。我不认为为每个组创建一个新文件是正确的方法。

【问题讨论】:

    标签: azure azure-data-factory azure-data-factory-2 azure-data-lake-gen2


    【解决方案1】:

    我认为您有几个问题需要解决。首先,标准 Blob 不支持追加操作。为此,您需要一个 AppendBlob。第二个问题是 ADF 不支持 AppendBlob。

    这里是a question,我在这里讨论复制活动和 AppendBlob。

    这里是 another answer(不是我的),它使用了一种有趣的方法,它使用本机 REST API 来附加 blob。

    另一种选择是让进程在每次运行时创建一个新文件。全部创建完成后,您可以使用 DataFlow 将它们折叠成一个文件。

    【讨论】:

    • 感谢您的指导。我改变了我的方法,在数据工厂管道中使用 azure 函数来完成繁重的工作,然后使用数据流来合并结果。
    猜你喜欢
    • 2020-07-06
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2018-08-01
    • 2023-03-25
    • 2020-08-21
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多