【问题标题】:How to predict a continuous variable without any output data ? All i have is Input data如何在没有任何输出数据的情况下预测连续变量?我所拥有的只是输入数据
【发布时间】:2020-01-10 19:21:07
【问题描述】:

我正在开展一个网络安全项目,其中我们必须根据现有的特征来确定漏洞的优先级,这些特征主要是分类变量(也包括几个序数变量)。

这里的目标是检测最有可能被利用的漏洞,从而确定优先级。因此,我们必须预测 0-10 的分数。我们预测的最高评级(在本例中为 10)将是需要立即关注的最严重的漏洞。

我们所拥有的只是分类变量(作为输入特征)。

在这里再次总结问题:

当前输入特征:所有分类变量(带有几个序数变量)

当前输出功能:不存在

预期输出:预测 0-10 范围内的分数,其中 10 是最严重的漏洞

从来没有遇到过这种问题。看起来回归绝对不是答案。能否请您分享您的想法。

【问题讨论】:

    标签: python machine-learning predict continuous


    【解决方案1】:

    我可能有误解,但您似乎没有做出预测所需的信息。

    我的理解是您有类别信息但没有其他关联。对于某些类别,您可能能够根据专家意见对您的预测进行硬编码。预测 ping 扫描基本上是良性的,例如,只需知道它叫什么。对于任何更具动态性的内容,您需要的信息比您列出的更多。

    【讨论】:

      【解决方案2】:

      如果您不能自己分配分数,机器学习算法将无法做到这一点。它不知道要优化什么。

      但是,您可以通过使用无监督算法根据分类值对数据进行聚类,然后查看聚类并确定哪些聚类似乎存在最重要的问题,从而获得成功。您可以找到关于分类 k 均值聚类的讨论 here

      【讨论】:

      • 感谢您的建议。但是,在对数据进行聚类之后,如果我们需要在该聚类中对数据点进行评级或层次结构,那么与质心的距离是否是衡量该数据点的一个很好的指标,或者有没有其他更好的方法来确定优先级
      猜你喜欢
      • 2012-01-17
      • 2020-07-03
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      相关资源
      最近更新 更多