【问题标题】:Alert Mechanism for a DataWarehouse数据仓库的警报机制
【发布时间】:2015-10-02 13:09:32
【问题描述】:

我们是一个可操作的数据仓库。我们有一个包含以下信息的批处理控制表

  1. 处理到仓库的文件名。
  2. 批处理开始的日期和时间。
  3. 处理的行数和花费的时间。

我们正在考虑建立一种警报机制,基本上可以在以下任何异常情况下发出警报(通过分析过去的数据):

  1. 文件未到达。
  2. 文件的处理时间超过了平均处理时间。
  3. 文件的行数非常低或非常高。

解决此问题的最佳方法是什么。这是机器学习的候选人吗?

【问题讨论】:

    标签: data-warehouse


    【解决方案1】:

    这是机器学习的候选者吗?

    不是真的。您必须将有关已处理文件的某些信息存储到数据仓库中。

    文件没有到达。

    当下一个文件到达时,您必须有一个文件列表的时间表。如果文件延迟超过 5 天,调度程序会发出警报、发送电子邮件或其他方式。

    一个文件的处理时间超过了平均处理时间。

    在您的文件计划中保留平均处理时间。当当前处理时间与平均处理时间相差超过2个标准差时,发出警报。

    文件的行数非常低或非常高

    在您的文件计划中保留平均行数。当当前行数与平均行数相差超过 2 个标准差时,发出警报。

    我选择了平均值的 2 个标准差作为例外情况。随意调整它以或多或少对偏差敏感。

    【讨论】:

    • 感谢您的回复。我有一个问题。如果特定批次的行数异常高,我是否将它们包括在我的平均计算中?有没有这方面的规定?
    • @Gilbert 如果行数或处理时间不服从正态分布,SD 可能会误导...
    • @Anand Kannan:我会说,不,但你比我更了解你的数据。
    • @Marmite Bomber:我的猜测是平均行数和平均处理时间会随着时间的推移而增加。是的,这不是正态分布。尽管如此,标准偏差对于确定异常的行数或异常的处理时间还是很有用的。
    • @Gilbert 趋势是另一个重要主题。我的意思是首先检查分布。例如。如果您在工作时间有大文件而小文件,则需要另一种 SD 方法。
    【解决方案2】:

    1) 首先从人类学习开始

    绘制已处理文件的时间序列(行号作为处理时间的函数)。

    绘制行号的分布(或直方图)

    绘制处理之间时间间隔的分布(或直方图)

    绘制依赖于行数的处理时间函数。

    您是否看到时间序列中的一些模式?是否有一天中的某个时间。工作日周期?你看到趋势了吗?

    处理时间的函数是连续函数还是简单的点散点图?

    您越清楚地看到一些模式和阈值,您就越容易实施检查。

    2) 收集失败历史

    使用处理状态扩展您的元数据 - 正常或失败原因。 这将使您能够以两种颜色(正/负情况)绘制图形,并帮助您决定是否可以在它们之间绘制阈值线(曲线)。

    您也可以申请supervised learning algorithms

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 1970-01-01
      • 2010-11-06
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      相关资源
      最近更新 更多