【问题标题】:Building Google Cloud Platform Data Catalog on unstructured data在非结构化数据上构建 Google Cloud Platform 数据目录
【发布时间】:2020-06-05 05:23:18
【问题描述】:

我有文档图像形式的非结构化数据。我们正在将这些文档转换为 JSON 文件。我现在想为此捕获技术元数据。有人可以给我一些关于在 Google Cloud Platform 中基于非结构化数据构建数据目录的提示/最佳做法吗?

【问题讨论】:

    标签: google-cloud-platform metadata google-data-catalog


    【解决方案1】:

    此答案假设您没有使用任何工具围绕非结构化数据创建架构并查询您的数据,例如BigQueryHivePresto。而您只是想对您的文件进行编目。

    我有一个类似的用例,Google 数据目录可以选择创建custom entries

    在非结构化文件数据上构建数据目录的一些技巧:

    1. 在您的 JSON 文件中使用有意义的文件名。这样搜索它们会变得更容易。
    2. 由于您已经在使用 GCP,因此请使用他们的托管数据目录,并利用他们的 custom entries API 将文件元数据提取到其中。
    3. 如果您还想在 JSON 文件中查找敏感数据,可以运行 DLP on them
    4. 使用Data Catalog Tags 丰富文件元数据。链接上的教程展示了如何在 Big Query 表上执行此操作,但您可以在 custom entries 上执行相同操作。

    我将添加一些有关将 JSON 文件中的这些文档转换为标签的 ETL 作业的信息。比如执行时间、数据质量得分、用户、企业主等。

    如果您想知道如何执行第 2 步,我将编写一个自动执行此操作的脚本: GitHub 的链接。另一种选择是使用Data Catalog Filesets

    所以在使用custom entriesfilesets 之间,我想问你这个,你需要关于你的文件名的信息吗?

    如果不是这样,那么文件集可能会更容易,因为在撰写本文时它不会显示有关您的文件名的任何信息,但可以很好地管理 GCS 存储桶中的文件模式:It is defined by one or more file patterns that specify a set of one or more Cloud Storage files.

    datatalog-util 还可以选择enrich your filesets,以防您只想获得有关它们的统计信息,例如平均文件大小、类型等。

    【讨论】:

      猜你喜欢
      • 2019-02-26
      • 1970-01-01
      • 1970-01-01
      • 2021-05-21
      • 2011-03-10
      • 2015-10-09
      • 2014-10-18
      • 1970-01-01
      • 1970-01-01
      相关资源
      最近更新 更多