【问题标题】:Yarn parsing job logs stored in hdfs存储在 hdfs 中的纱线解析作业日志
【发布时间】:2015-05-08 10:37:16
【问题描述】:

是否有任何解析器,我可以使用它来解析存储在 hdfs 中以从中提取信息的纱线作业日志(jhist 文件)中存在的 json。

【问题讨论】:

    标签: json mapreduce hadoop-yarn


    【解决方案1】:

    .jhist 文件中的第二行是文件中其他 json 的 avro 模式。这意味着您可以从 jhist 文件中创建 avro 数据。 为此,您可以使用avro-tools-1.7.7.jar

    # schema is the second line
    sed -n '2p;3q' file.jhist > schema.avsc
    
    # removing the first two lines
    sed '1,2d' file.jhist > pfile.jhist
    
    # finally converting to avro data
    java -jar avro-tools-1.7.7.jar fromjson pfile.jhist --schema-file schema.avsc > file.avro
    

    您有一个 avro 数据,例如,您可以将其导入 Hive 表并对其进行查询。

    【讨论】:

    • 这个也可以用来解析avro二进制文件吗?我尝试解析 avro 二进制格式的 .jhist 文件,在尝试转换时,遇到一些二进制字符时会引发错误。
    【解决方案2】:

    你可以查看Rumen,一个来自apache生态系统的解析工具 或者当您访问 Web UI 时,转到作业历史记录并查找要读取 .jhist 文件的作业。点击左侧的 Counters 链接,现在您将能够看到一个 API,它为您提供所有参数和值,例如 CPU 时间(以毫秒为单位)等,这些值将从 .jhist 文件本身读取。

    【讨论】:

    • 谢谢,伙计!这对我真的很有帮助。
    猜你喜欢
    • 2016-05-13
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2021-07-15
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2019-12-31
    相关资源
    最近更新 更多