【问题标题】:Text classification with imbalanced data具有不平衡数据的文本分类
【发布时间】:2020-03-16 02:07:04
【问题描述】:

我试图将 10000 个文本样本分类为 20 个类别。其中 4 个类每个只有 1 个样本,我尝试 SMOTE 来解决这种不平衡,但我无法为只有一个记录的类生成新样本,尽管我可以为超过 1 个样本的类生成样本。有什么建议吗?

【问题讨论】:

    标签: machine-learning nlp data-science text-classification imbalanced-data


    【解决方案1】:

    可以在this answer 中找到有关 SMOTE 的一个很好的解释器(以及关于为什么它可能不适用于欠采样类的问题的潜在答案)。

    我认为这个问题无法通过现成的数据增强策略轻松解决。一种可能性可能是简单地复制示例,但这不会为您的模型添加新信息。

    您也可以尝试以下几种其他策略:

    1. 2015 paper by William Wang and Diyi Yang 中描述了一种基于嵌入的增强技术(类似于 SMOTE 的理论,但在文本数据上效果更好)。
    2. 使用2017 paper by Marzieh Fadaee, Arianna Bisazza, and Christof Monz 中描述的上下文化词嵌入在#1 上更进一步。
    3. 使用 WordNetAug 等同义词替换库。

    【讨论】:

    • 谢谢@nlpnoah,我尝试了bert同义词,并得到了一些积极的结果。
    猜你喜欢
    • 2017-05-26
    • 2016-04-02
    • 2019-07-27
    • 2020-10-23
    • 2018-11-15
    • 2021-09-27
    • 2020-06-27
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多