【问题标题】:Does Google BigQuery supports Parquet file format?Google BigQuery 是否支持 Parquet 文件格式?
【发布时间】:2015-10-27 13:45:47
【问题描述】:

我想知道 Google BigQuery 目前是否支持Parquet file format,或者是否有计划支持它?

我知道它目前支持 CSV 和 JSON 格式。

【问题讨论】:

标签: google-bigquery parquet


【解决方案1】:

** 自 2018 年 3 月 1 日起,支持 loading Parquet 1.0 files

在 BigQuery CLI 中,--source_format PARQUET 选项在bq --help 的输出中进行了描述。

我从来没有使用过它,因为当我在试验这个功能时,它仍然是仅限邀请的,我没有请求邀请。

我的用例是 Parquet 文件的大小是 Avro 文件的一半。我想尝试一些新的东西并有效地上传数据(按此顺序)。

% bq load --source_format PARQUET test.test3 data.avro.parquet schema.json 
Upload complete.
Waiting on bqjob_r5b8a2b16d964eef7_0000015b0690a06a_1 ... (0s) Current 
status: DONE   
[...]

【讨论】:

  • 您收到的错误是“未启用”。在这个问题issuetracker.google.com/issues/35905411 我看到提到项目可以使用它。也许这只是“测试版”功能的问题,需要启用以供您试验。
  • 补充这个答案:如果我们使用“WriterVersion PARQUET_1_0”版本,Parquet 可以正确加载到 BigQuery 中。如果 Parquet 文件使用 PARQUET_2_0,则 Parquet 无法加载到 BigQuery:issuetracker.google.com/issues/116699318
【解决方案2】:

目前 BigQuery 不支持 Parquet 文件格式。但是,我们有兴趣了解有关您的用例的更多信息 - 您对导入、导出或两者感兴趣吗?你打算如何使用它?更好地了解这些场景将有助于 BigQuery 团队做出相应的计划。

【讨论】:

  • 感谢您的快速回复!我目前没有任何特定的用例。我们目前将 CSV 文件导入 BigQuery,我想知道如果我们将格式更改为 Parquet 是否仍然有效。将文件存储在 Parquet 或 ORC 中将使我们能够灵活地以比 CSV 文件更快的方式分析 Hadoop 中的文件。
【解决方案3】:

如果您想在 BigQuery 和 Hadoop 之间共享文件格式,可以使用换行符分隔的 JSON 记录。

BigQuery 支持将这些用于导入和导出。

Hadoop 也支持这一点。搜索互联网会发现许多热门内容,其中显示了使其发挥作用的食谱。这是一个:Processing JSON using java Mapreduce

【讨论】:

    【解决方案4】:

    当您处理数亿行并需要将数据移动到本地 Hadoop 集群时,即从 bigQuery 导出,json 只是不可行的选择,avro 也好不了多少,这是当今唯一有效的选择对于这种数据的移动是 gz 不幸的是,它不可能在 Hadoop 中本地读取,Larquet 是这个用例的唯一有效方式,我们没有任何其他有效的选择

    【讨论】:

      【解决方案5】:

      示例(part-* 是这里的秘诀):

      bq load --source_format=PARQUET --replace=true abc.def gs://abc/def/part-*
      

      【讨论】:

        猜你喜欢
        • 1970-01-01
        • 2017-01-10
        • 1970-01-01
        • 1970-01-01
        • 2016-01-26
        • 1970-01-01
        • 2019-01-24
        • 1970-01-01
        • 2020-06-19
        相关资源
        最近更新 更多