【发布时间】:2017-07-29 01:50:21
【问题描述】:
我有大量不同尺寸和随机尺寸的图像。
我想确保 - 我的训练集不是多余的 - 我的测试集中的数据都是不同的(与测试集中的其他数据和训练集中的数据不同)
不是多余的,我的意思是检查一个图像是否不是另一个图像的裁剪版本(或最大扩展的相同图像)。
在网络上工作时,您一般如何处理此类情况? 有什么可能以某种方式为 Tensorflow 中的这个插件做好准备吗?
感谢您的帮助
K。
【问题讨论】:
-
太棒了!!非常感谢@ThomasPinetz! (我的谷歌搜索没有输出这个;))会检查最适合我的女巫。
-
虽然我不是 ML 专家,但我觉得这样做可能会适得其反。首先,如果重复项代表您的原始分布,则删除它们可能会使结果恶化;其次,在从图像数据集中学习时,通常会添加随机裁剪和变换的样本,以增加样本数量和鲁棒性。
-
请注意,询问工具建议对于 SO 来说是题外话。您可能需要考虑编辑它。
-
@phg 它不代表原始分布。此外,在我的具体情况下,重要的是我的测试集将与训练中使用的任何数据完全断开。
标签: python image-processing tensorflow neural-network deep-learning