【问题标题】:Transfer Learning for small datasets of structured data结构化数据的小型数据集的迁移学习
【发布时间】:2020-06-20 03:25:20
【问题描述】:

我希望针对与特定供应链领域的费用审批相关的小型数据集构建的问题实施机器学习。通常标记的数据不可用

我希望在一个已标记数据的数据集中构建模型,然后使用在类似环境中开发的模型 - 其中功能集非常相似,但不相同。期望这可以作为建议的起点并在新的上下文中收集标记数据。

我明白这是迁移学习的精髓。我在这个领域读到的大多数例子都是关于图像数据集的——任何指导如何使用标准的基于树的分类算法在小型数据集中利用它

【问题讨论】:

    标签: machine-learning supervised-learning transfer-learning


    【解决方案1】:

    raghu,当您说深度学习中的抽象层时,我相信您正在寻找一种内核方法。有几种支持核函数的 ML 算法。使用内核函数,您也许可以做到;但是使用内核函数可能比解决原始问题更复杂。我倾向于 Tdoggo 使用决策树的建议。

    对不起,我想添加评论,但他们不允许我,所以我发布了一个新答案。

    【讨论】:

      【解决方案2】:

      我不能真正谈论基于树的算法,我不知道如何使用它们进行迁移学习。但是,对于深度学习模型,迁移学习的惯用方法是加载预训练模型,然后使用新数据重新训练数据集的最后一层,然后微调网络的其余部分。

      如果您没有太多数据要处理,您可能会考虑创建合成数据。

      【讨论】:

      • 感谢您的意见。我正在避免使用深度学习模型,因为在我面临的简单场景中,复杂性是不合理的。虽然我了解深度学习模型在初始层中创建抽象,但这里有抽象的等价物吗?我将如何处理增量的新功能和缺失的功能
      【解决方案3】:

      使用基于树的算法,您可以按照您说的做:在一个数据集上训练树并将其应用于另一个类似的数据集。您需要做的就是更改第二棵树上的术语/节点。

      例如,假设您有一个经过训练的决策树,用于过滤建筑公司的费用。你会直接拒绝任何工作靴的报销,因为工人应该自己提供这些。

      您想在您的会计师事务所使用训练有素的树,因此您不使用工作靴,而是将该术语更改为笔记本电脑,因为会计师应该购买自己的。

      这有意义吗,对你有帮助吗?

      【讨论】:

        【解决方案4】:

        经过一些研究,我们决定继续使用随机森林模型,直觉是原始模型中具有共同特征的树将成为决策的起点。

        随着我们在新上下文中获得更多标记数据,我们将开始用新树替换原始树,这些树包含 (a) 仅新特征和 (b) 新旧特征组合

        这有助于在初步试验中提供合理的结果

        【讨论】:

          猜你喜欢
          • 1970-01-01
          • 2011-10-03
          • 2018-05-30
          • 2019-10-29
          • 2020-05-21
          • 2020-04-15
          • 2020-06-02
          • 2022-08-08
          • 1970-01-01
          相关资源
          最近更新 更多