【问题标题】:H2o error on parsing a file解析文件时出现 H2o 错误
【发布时间】:2018-03-29 16:08:15
【问题描述】:

我也在解析一个包含 UUID 类型的文件。 我无法解析文件并收到此错误。

DistributedException from /127.0.0.1:54321: 'NewChunk has type Numeric, but the Vec is of type UUID', 由 java.lang.AssertionError 引起:NewChunk has type Numeric, but the Vec is of type UUID

有人知道这是什么意思吗?

【问题讨论】:

  • 请提供一个你现在尝试如何做的例子,如果可能的话也提供一个数据样本。有多种方法可以将数据导入h2o。您的数据来自什么类型的来源?
  • 我正在使用流程 UI。数据来自 csv 文件。我在此处共享了 csv 文件。 drive.google.com/open?id=0B9A7NrDPc-aQeTN0QnlpcWFROVE

标签: machine-learning artificial-intelligence data-science h2o


【解决方案1】:

我在本地下载了您的 160MB 文件进行实验,发现您的数据格式错误。

您看到上述错误只是因为数据集中的最后一列是 UUID,因此 H2O 确保将列类型设置为 UUID,但是最后一列之后的 206000 行显示数值,这会导致 H2O 在将数值设置为 UUID 时出现恐慌.

我能够在 H2O 中加载多达 206000 行而没有任何问题,但是 207000 行给了我错误,因此您可以试验哪些行格式错误。您可以运行以下命令来获取从 206000 到 207000 的所有行,当加载这 1000 行时,您会看到同样的问题。

$ sed -n '206000,207000p' < consumer_complaints.csv > consumer_complaints_bad.csv

如果您无法在行级别修复格式错误的数据,您可以将所有列保存为字符串。这样,H2O 会将所有数据作为字符串摄取,然后您可以分析数据,正确清理数据,然后将类型正确更改为 enum、int 或 UUID。尝试不是一个好的选择,因为您的数据格式已经错误,但这样您可以将所有数据加载到 H2O 中。

【讨论】:

    猜你喜欢
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2013-12-09
    • 1970-01-01
    • 2014-09-17
    • 2012-11-09
    • 1970-01-01
    相关资源
    最近更新 更多