【发布时间】:2015-12-23 07:18:16
【问题描述】:
我们通过 Elasticsearch (2.1.0) 和 Kibana (4.3.0) 分析了 Apache 日志。 日志由运行在 Web 服务器上并读取 Apache 组合日志格式的 Logstash 解析并发送到 Elasticsearch。 一切正常,但现在我们需要分析更复杂的模式。 我们有具有“purchase_id”字段的文档,该字段具有整数值(如 130012、130016、133552 等)。 我们有其他文档,其中包含具有相同值的整数字段“view_id”(如 130012、130016、133552 等)
这两个字段永远不会出现在同一个文档中,因为这些字段是从 Apache 日志中的不同 URI 中提取的。 我们的目标是计算和可视化“purchase_id”中的值与“view_id”中的值在给定时间范围内的出现百分比。 例如,假设我们想查看项目 130012 的当前购买率。它可能在最后 30 秒内出现在字段为“purchase_id”的文档中 1000 次,在同一最后 30 秒内,它可能在字段为“view_id”的文档中出现 40000 次. 这很明显,因为与接触产品的人数相比,只有少数人购买了商品。我需要计算和可视化,在时间范围内,项目 130012 的 purchase_id 有 1000 倍,项目 130012 的 view_id 有 40000 倍,然后将 1000 除以 40000 并乘以 100%,这样我在仪表板上得到了 2.5% 的可视化(对于项目 130012)。 当然我有很多这样的 purchase_id=view_id=(some number):int 对,所以我需要计算所有它们的百分比并显示,比如说 20 百分比最高。 与我们投资的广告相比,这将使我知道最畅销的商品。
【问题讨论】:
标签: elasticsearch logstash kibana-4