【发布时间】:2020-03-16 02:07:04
【问题描述】:
我试图将 10000 个文本样本分类为 20 个类别。其中 4 个类每个只有 1 个样本,我尝试 SMOTE 来解决这种不平衡,但我无法为只有一个记录的类生成新样本,尽管我可以为超过 1 个样本的类生成样本。有什么建议吗?
【问题讨论】:
标签: machine-learning nlp data-science text-classification imbalanced-data
我试图将 10000 个文本样本分类为 20 个类别。其中 4 个类每个只有 1 个样本,我尝试 SMOTE 来解决这种不平衡,但我无法为只有一个记录的类生成新样本,尽管我可以为超过 1 个样本的类生成样本。有什么建议吗?
【问题讨论】:
标签: machine-learning nlp data-science text-classification imbalanced-data
可以在this answer 中找到有关 SMOTE 的一个很好的解释器(以及关于为什么它可能不适用于欠采样类的问题的潜在答案)。
我认为这个问题无法通过现成的数据增强策略轻松解决。一种可能性可能是简单地复制示例,但这不会为您的模型添加新信息。
您也可以尝试以下几种其他策略:
【讨论】: