【发布时间】:2015-05-08 10:37:16
【问题描述】:
是否有任何解析器,我可以使用它来解析存储在 hdfs 中以从中提取信息的纱线作业日志(jhist 文件)中存在的 json。
【问题讨论】:
标签: json mapreduce hadoop-yarn
是否有任何解析器,我可以使用它来解析存储在 hdfs 中以从中提取信息的纱线作业日志(jhist 文件)中存在的 json。
【问题讨论】:
标签: json mapreduce hadoop-yarn
.jhist 文件中的第二行是文件中其他 json 的 avro 模式。这意味着您可以从 jhist 文件中创建 avro 数据。 为此,您可以使用avro-tools-1.7.7.jar
# schema is the second line
sed -n '2p;3q' file.jhist > schema.avsc
# removing the first two lines
sed '1,2d' file.jhist > pfile.jhist
# finally converting to avro data
java -jar avro-tools-1.7.7.jar fromjson pfile.jhist --schema-file schema.avsc > file.avro
您有一个 avro 数据,例如,您可以将其导入 Hive 表并对其进行查询。
【讨论】:
你可以查看Rumen,一个来自apache生态系统的解析工具 或者当您访问 Web UI 时,转到作业历史记录并查找要读取 .jhist 文件的作业。点击左侧的 Counters 链接,现在您将能够看到一个 API,它为您提供所有参数和值,例如 CPU 时间(以毫秒为单位)等,这些值将从 .jhist 文件本身读取。
【讨论】: