【问题标题】:variational autoencoder with limited data数据有限的变分自编码器
【发布时间】:2022-06-27 11:54:50
【问题描述】:

我正在做一个二元分类项目,我正在使用 VAE(变分自动编码器)通过为少数类生成新样本来处理两个类之间的不平衡。

第一类(多数类)包含 20000 个样本,第二类(少数类)包含 500 个样本。

在少数类上训练 VAE 模型后,我为该类生成了新样本并将它们添加到训练集中,然后我训练了两个分类模型,一个在不平衡数据上训练的模型(仅训练集)和第二个一个用训练集 + 由 VAE 生成的数据训练)。问题是第一个模型比第二个模型给出的结果更好(f1-score,Roc auc...),我认为问题可能是因为 VAE 训练的数据量有限。

请帮忙。

【问题讨论】:

    标签: tensorflow autoencoder data-augmentation data-generation


    【解决方案1】:

    虽然 500 个训练图像不足以从 VAE 生成多样化的图像,但您仍然可以尝试生成一些图像。最好取 10 个不同图像(甚至更多)的潜在值并将其传递给解码器(如果你已经这样做了,请忽略它。如果你正在使用其他方法,试试这个)。

    如果它仍然不起作用,那么我建议您在整个数据集上构建一个条件 VAE。在条件 VAE 中,您使用标签训练 VAE,这样您的模型不仅可以学习重建,还可以学习它正在重建的图像类别。这可以帮助您生成任何特定类的图像。

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 2017-12-05
      • 2018-03-04
      • 2022-10-01
      • 2021-03-21
      • 1970-01-01
      相关资源
      最近更新 更多