【发布时间】:2022-06-27 11:54:50
【问题描述】:
我正在做一个二元分类项目,我正在使用 VAE(变分自动编码器)通过为少数类生成新样本来处理两个类之间的不平衡。
第一类(多数类)包含 20000 个样本,第二类(少数类)包含 500 个样本。
在少数类上训练 VAE 模型后,我为该类生成了新样本并将它们添加到训练集中,然后我训练了两个分类模型,一个在不平衡数据上训练的模型(仅训练集)和第二个一个用训练集 + 由 VAE 生成的数据训练)。问题是第一个模型比第二个模型给出的结果更好(f1-score,Roc auc...),我认为问题可能是因为 VAE 训练的数据量有限。
请帮忙。
【问题讨论】:
标签: tensorflow autoencoder data-augmentation data-generation