【发布时间】:2014-11-24 09:49:53
【问题描述】:
我是 hadoop 新手,正在尝试在 hive 中导入文件。我使用的源数据在某些列之间没有分隔符。
例子:
0000856214AB25 256 T PL1423AS ......
2563458547CD12 748 S AK2523YU ... and so on...
我已从大型机中以 txt 格式导入此文件。我的字段具有固定数量的字符第一列(1-10),第二列(11-12),第三列(13-14))
我想要的结果是读取这个原始数据如下:
1st column - 0000856214
2nd column - AB
3rd column - 25
4th column - 256
5th column - T
6th column - PL
7th column - 1423AS
如何使用 hive 导入这些数据?
【问题讨论】:
-
您可以尝试使用RegEx SerDe,它允许您根据正则表达式解析您的列,例如cwiki.apache.org/confluence/display/Hive/…
-
我是新手。你能帮我举个例子吗?那会很有帮助。谢谢
-
@Palash 更新了解决方案,请检查您的输入。
-
some1 可以帮助我吗?我的最后一个查询yyyyyy。
标签: hadoop mapreduce hive hbase