【问题标题】:How to deal with a highly imbalanced Issue(Text) classification Dataset?如何处理高度不平衡的问题(文本)分类数据集?
【发布时间】:2019-11-04 15:03:07
【问题描述】:

数据集大小:81256, 班级:200, 每个类别的范围从特定类别下的 2757 到特定类别下的低至 10 不等。其高度不平衡。 如何平衡这个数据集以及应该使用什么类型的算法来训练模型。 现在我已经使用随机采样器进行采样和线性 SVC 来训练模型。

【问题讨论】:

  • 欢迎来到 SO,这是关于特定编码的问题,而不是关于一般编程建议和建议;你的问题太宽泛了(就像阶级不平衡本身的问题一样),请花点时间阅读How to AskWhat topics can I ask about here?

标签: python machine-learning nlp


【解决方案1】:

这是一个非常笼统的问题,但处理文本中不平衡数据的一些方法(不仅如此)是:

  • 收集更多数据
  • 过采样少数类
  • 欠采样多数类
  • 通过反向翻译进行扩充:使用一些翻译 API(Google 翻译)将您的文本翻译成另一种语言,然后将翻译后的文本翻译回原始语言
  • 通过同义词增补:用同义词替换文本中的一些词
  • 使用不需要大量数据进行微调的预训练模型(BERT、GTP-2)

【讨论】:

    猜你喜欢
    • 2019-08-30
    • 2019-07-13
    • 2017-11-03
    • 2016-02-22
    • 2020-06-27
    • 1970-01-01
    • 2019-09-07
    • 1970-01-01
    • 2019-06-11
    相关资源
    最近更新 更多