【发布时间】:2016-09-12 07:38:01
【问题描述】:
我想将数据存储在 spark 中,以使相差 5 秒或更短的时间戳与相应的数据一起落入一个 5 秒的存储桶中。同样,下一组 5 秒存储桶包含剩余的日志。 (这样我就可以汇总存储桶中的数据)。我的日志:
1472120400.107 HTTP GEO er.aujf.csdh.jkhydf.eyrgt
1472120399.999 HTTP GEO er.asdhff.cdn.qyirg.sdgsg
1472120397.633 HTTP GEO er.abff.kagsf.weyfh.ajfg
1472120397.261 HTTP GEO er.laffg.ayhrff.agyfr.yawr
1472120394.328 HTTP GEO er.qfryf.aqwruf.oiuqwr.agsf
1472120393.737 HTTP GEO er.aysf.aouf.ujaf.casf
.
.
.
我仍然无法弄清楚如何在火花中做到这一点。
时间戳为1472120400.107,1472120399.999,1472120397.633,1472120397.261等的日志落入一个bucket,下一组落入下一个bucket,以此类推。
输出:
时间戳为 1472120400.107,1472120399.999,1472120397.633,1472120397.261 的所有日志行都将保存在内存中(一个桶),以便进一步处理,例如查找整个桶的计数。同样,下一个桶。
【问题讨论】:
-
你的预期输出是什么?
-
“桶”是什么意思?
-
这不过是对日志进行分区。分区的日志组形成存储桶。
标签: apache-spark pyspark