【发布时间】:2021-03-06 02:20:09
【问题描述】:
我正在尝试通过 bq load/bq mk 将存储在 GCS 中的 ORC 数据文件加载到 BigQuery 中,并遇到以下错误。通过 hadoop discp 命令从本地集群的 Hive 实例版本 1.2 复制的数据文件。大多数 orc 文件都已成功加载,但很少有。当我从 Hive 读取这些数据时没有问题。
我使用的命令:
$ bq load --source_format ORC hadoop_migration.pm hive/part-v006-o000-r-00000_a_17
Upload complete.
Waiting on bqjob_r7233761202886bd8_00000175f4b18a74_1 ... (1s) Current status: DONE
BigQuery error in load operation: Error processing job '<project>-af9bd5f6:bqjob_r7233761202886bd8_00000175f4b18a74_1': Error while reading data, error message:
The Apache Orc library failed to parse metadata of stripes with error: failed to open /usr/share/zoneinfo/GMT-00:00 - No such file or directory
确实,没有这样的文件,我认为不应该。
Google 不知道此错误消息,但我在这里发现了类似的问题:https://issues.apache.org/jira/browse/ARROW-4966。本地服务器有一种解决方法,可以创建指向 /usr/share/zoneinfo/GMT-00:00 的符号链接。但我在云端。
此外,我发现如果我通过 orc-tools 从 orc 文件中提取数据为 json 格式,我可以将该 json 文件加载到 BigQuery 中。所以我怀疑问题不在数据本身。
有人遇到过这样的问题吗?
【问题讨论】:
标签: google-cloud-platform hive google-bigquery orc