【问题标题】:Linear Regression Model that improves as the user selects and trains data随着用户选择和训练数据而改进的线性回归模型
【发布时间】:2019-10-09 09:20:30
【问题描述】:

我正在开发一个脚本,用于检测来自生物源的信号数据的峰值。我想创建一个半自动模型来帮助预测哪些峰是正确的。随着用户手动选择其中一些峰值来帮助教模型哪些是正确的,该脚本得到了改进。

我想要达到的工作流程是这样的: 1.用户手动选择数据 2. 脚本获取正确的数据并将其拟合到模型中 3. 使用模型预测给定峰正确的可能性。 4. 希望有足够的数据和培训,它可以自动运行其余部分。

我也不知道一般主题的名称,我正在努力寻找谷歌的内容。

我已尝试将其拟合到 scikit learn 中的线性回归模型,但我没有足够的数据集(因为它从用户的第一次干预中学习)。我正在做的事情可能吗?

【问题讨论】:

    标签: python scikit-learn


    【解决方案1】:

    很抱歉这个答案的笼统性,但 OP 要求提供一般性主题。

    听起来semi-supervised learninghere for scikit-learnhere for more details 可能有效。

    没有要开始的标记数据。开始手动过程以获取一些标记数据。很快,半监督就可以开始并接管——通过一个过程来衡量其准确性。适合您的情况,是一个很好的起点。

    最终,您可能拥有“足够”正确标记的数据,您可以研究拟合经典算法来预测余数。 “足够”与问题的难度有关。可能是数十、数百、数千……

    根据您情况的其他详细信息,Reinforcement learning 可能有效。正如您所描述的情况,这可能行不通,但您的环境中可能还有其他细节可以利用这个系列。

    警告 - 特别是机器学习和半监督学习可能并不总是对所有问题都有效。测量,测量,测量。

    【讨论】:

    • 谢谢克雷格!我阅读了您发送的链接,但这些方法目前仍按批次处理输出(我认为)。尽管可以对其进行调整,但我认为使用 Online ML 仍然会更有效率。再次感谢!!
    【解决方案2】:

    感谢大家的帮助。我正在和一位同事交谈,他将我推荐给Online Machine Learning。我想这就是我要找的那个。虽然我不会处理时间序列数据或来自在线的流式数据,但我认为该方法足以满足我的需求。这种方法允许一个一个地训练数据,而不是批量训练。我认为 SciKit Learn 目前不具备开箱即用的在线机器学习能力。

    This 我认为对在线机器学习的优势进行了很好的总结(还展示了 creme python 库)。

    再次感谢!

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 2018-09-01
      • 2022-07-14
      • 2021-03-03
      • 2014-05-07
      相关资源
      最近更新 更多