【问题标题】:[Vertica][VJDBC](100172) One or more rows were rejected by the server[Vertica][VJDBC](100172) 一行或多行被服务器拒绝
【发布时间】:2016-01-19 14:24:34
【问题描述】:

使用 Sqoop 将数据从 Impala 加载到 Vertica 时出现以下错误。

Error: java.io.IOException: Can't export data, please check failed map 任务日志在 org.apache.sqoop.mapreduce.TextExportMapper.map(TextExportMapper.java:112) 在 org.apache.sqoop.mapreduce.TextExportMapper.map(TextExportMapper.java:39) 在 org.apache.hadoop.mapreduce.Mapper.run(Mapper.java:145) 在 org.apache.sqoop.mapreduce.AutoProgressMapper.run(AutoProgressMapper.java:64) 在 org.apache.hadoop.mapred.MapTask.runNewMapper(MapTask.java:787) 在 org.apache.hadoop.mapred.MapTask.run(MapTask.java:341) 在 org.apache.hadoop.mapred.YarnChild$2.run(YarnChild.java:163) 在 java.security.AccessController.doPrivileged(Native Method) 在 javax.security.auth.Subject.doAs(Subject.java:422) 在 org.apache.hadoop.security.UserGroupInformation.doAs(UserGroupInformation.java:1671) 在 org.apache.hadoop.mapred.YarnChild.main(YarnChild.java:158) 引起 通过:java.io.IOException:java.sql.BatchUpdateException: [Vertica]VJDBC 一个或多个行被服务器拒绝。 在 org.apache.sqoop.mapreduce.AsyncSqlRecordWriter.write(AsyncSqlRecordWriter.java:233) 在 org.apache.sqoop.mapreduce.AsyncSqlRecordWriter.write(AsyncSqlRecordWriter.java:46) 在 org.apache.hadoop.mapred.MapTask$NewDirectOutputCollector.write(MapTask.java:658) 在 org.apache.hadoop.mapreduce.task.TaskInputOutputContextImpl.write(TaskInputOutputContextImpl.java:89) 在 org.apache.hadoop.mapreduce.lib.map.WrappedMapper$Context.write(WrappedMapper.java:112) 在 org.apache.sqoop.mapreduce.TextExportMapper.map(TextExportMapper.java:84) ... 10 更多原因:java.sql.BatchUpdateException: [Vertica]VJDBC 一个或多个行被服务器拒绝。 在 com.vertica.jdbc.SStatement.processBatchResults(未知来源) 在 com.vertica.jdbc.SPreparedStatement.executeBatch(未知来源) 在 org.apache.sqoop.mapreduce.AsyncSqlOutputFormat$AsyncSqlExecThread.run(AsyncSqlOutputFormat.java:231)

我正在运行以下命令:

sudo -u impala sqoop export -Dsqoop.export.records.per.statement=xxx --driver com.vertica.jdbc.Driver --connect jdbc:vertica://host:5433/db --username name --password pw --table table --export-dir /some/dir -m 1 -- input-fields-terminated-by '\t' --input-lines-terminated-by '\n' --批处理

并非每次都出现此错误。我进行了几次成功的测试,加载了超过 200 万行数据。所以我猜可能有一些坏数据在被拒绝的行中包含特殊字符。这很烦人,因为当出现此错误时,mapreduce 作业将回滚并重试。在这种情况下,目标表中会有很多重复数据。

有没有人知道是否有任何可以设置为处理特殊字符的sqoop导出参数,或者是否有任何方法可以跳过坏数据,这意味着禁用回滚?谢谢!

【问题讨论】:

  • 为什么不试试 Talend 之类的东西?
  • 地图任务失败的错误是什么?

标签: hadoop mapreduce sqoop vertica impala


【解决方案1】:

这可能不仅仅是特殊字符。例如,如果您尝试将 'abc' 填充到数字字段中,则该行将被拒绝。即使您收到此错误,我也相信直到加载之后才应该提交所有可以提交的数据(但我会验证这一点)。如果您隔离“缺失”的行,您可能能够找出数据或字段定义有什么问题。

要查找的常见内容:

  1. 将字符类型数据填充到数字字段中(可能是隐式转换,或者仅在值非 NULL 时显示)。
  2. NULL 值到 NOT NULL 字段中
  3. 计数字符和VARCHAR 八位字节等效。 VARCHAR(x) 代表八位字节,但一个 UTF-8 字符可以有多个八位字节。
  4. 与 #3 类似,字符串太长而无法放入指定字段。

在驱动程序中,批量插入被替换为COPY FROM STDIN 语句。您也许可以在 query_requests 中找到该声明,但我不确定它是否会有所帮助。

Sqoop 并没有给您太多机会来进一步研究这个问题(据我所知,我检查了通用 JDBC 加载器)。可以查看executeBatch() 的返回数组,并将其与您的执行批次联系起来。也许修改通用 JDBC 加载器?

希望这会有所帮助。

【讨论】:

  • 感谢您的回答!你是对的。我只是仔细检查了我的源数据。我相信有一些不好的数据,比如 bigint 字段中的字符串。但是,当前版本的 Sqoop 无法跳过坏数据。 : (
  • 你也许可以做我上面提到的,基于 JDBC 加载器创建一个新的加载器并检查 executeBatch 返回数组。不过,我不确定 sqoop 的批处理类型。根据我对 Vertica COPY 工作原理的了解,我原以为它会加载所有数据,但失败的数据除外。你确定不是这样吗?
  • 感谢您的回答!问题解决了!原来这个错误是因为一些数据比定义长... vsql的副本可以自动截断更长的数据,但sqoop不能。
  • @yuan0122 如果它解决了您的问题,请确保您接受 woot 的回答。
猜你喜欢
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 2021-12-16
  • 2017-10-14
  • 1970-01-01
  • 2019-02-18
  • 1970-01-01
相关资源
最近更新 更多