【问题标题】:Ingesting Mainframe data into Hadoop using Sqoop使用 Sqoop 将大型机数据引入 Hadoop
【发布时间】:2015-12-15 13:22:32
【问题描述】:

我发现 Sqoop 1.4.6 可以连接到 Mainframe 它可以从 Mainframe PDS 中提取数据并放入 HDFS/Hive/Hbase 或 Accumulo。

我想知道它是否支持压缩十进制数据类型或仅支持简单数据类型? 有人可以帮助我了解 Sqoop 1.4.6 支持的所有大型机文件格式吗?

提前致谢

参考 https://sqoop.apache.org/docs/1.4.6/SqoopUserGuide.html

【问题讨论】:

  • 文档说?
  • 在刚刚提到的文档中它调用了从 PDS 中提取数据,我不确定它是否也调用了提取打包的十进制数据
  • 它还说“数据集中的记录只能包含字符数据”
  • "import-mainframe 工具将大型机上的分区数据集 (PDS) 中的所有顺序数据集导入到 HDFS。PDS 类似于开放系统上的目录。a 中的记录dataset 只能包含字符数据。 记录将与整个记录一起存储为单个文本字段。”在我看来它回答了你的问题。
  • 哈。所以我只是浪费时间为您查找文档。好吧,你有你的答案。

标签: hadoop hdfs sqoop mainframe


【解决方案1】:

嗨,根据我的分析,不支持压缩十进制数据,事实上,如果文件包含压缩十进制数据,其余数据也会被弄乱。详情请参考http://rbheemana.github.io/reality-of-sqoop-mainframe/。

【讨论】:

  • 因为您非常熟悉将 mainFrame 数据摄取到 hdfs.. 我们应该使用哪种方式每周将大型 mainFrame 文件获取到 hdfs..
【解决方案2】:

根据文档“9.2.6 文件格式”...

"... 默认情况下,数据集中的每条记录都存储为文本记录,末尾有一个换行符。假设每条记录包含一个名为 DEFAULT_COLUMN 的单个文本字段。当 Sqoop 将数据导入 HDFS 时,它会生成一个 Java 类,该类可以重新解释它创建的文本文件。..."

【讨论】:

    猜你喜欢
    • 2021-12-31
    • 1970-01-01
    • 1970-01-01
    • 2017-04-30
    • 1970-01-01
    • 1970-01-01
    • 2019-04-26
    • 2019-08-25
    相关资源
    最近更新 更多