【发布时间】:2019-05-31 01:32:17
【问题描述】:
我们正在使用 H2O(最新版本 3.22.1.1)从 s3 读取 parquet 数据。我们使用 python 与 H2O 对话。这是单个 H2O 实例 - 不是集群。
有时我们会收到此错误:
服务器错误 water.exceptions.H2OIllegalArgumentException: 错误:无法确定文件类型。对于 s3a://BUCKET_NAME/5c2e3fdc0c9c1800019c73f9/part-00001-c33635a2-76dc-4e49-948b-465726b7e3d9-c000.snappy.parquet
文件存在并且是有效的镶木地板文件。后续导入工作正常。
这是我们将文件导入H2O的python代码
h2o.import_file(path='s3a://BUCKET_NAME/5c2e3fdc0c9c1800019c73f9/part-00001-c33635a2-76dc-4e49-948b-465726b7e3d9-c000.snappy.parquet')
有没有办法强制 h2o 使用 parquet 类型?
【问题讨论】:
-
您在使用亚马逊服务吗??
-
是的... parquet 存储在 s3 中,h2o 在 ec2 中运行
-
你是说同样的 import_file() 调用是不稳定的,有时有效,有时无效?如果是这样,那听起来像是一个错误,我很想能够重现它。
标签: python amazon-s3 parquet h2o