【问题标题】:How to prevent redundancy in Image Data when training a network?训练网络时如何防止图像数据中的冗余?
【发布时间】:2017-07-29 01:50:21
【问题描述】:

我有大量不同尺寸和随机尺寸的图像。

我想确保 - 我的训练集不是多余的 - 我的测试集中的数据都是不同的(与测试集中的其他数据和训练集中的数据不同)

不是多余的,我的意思是检查一个图像是否不是另一个图像的裁剪版本(或最大扩展的相同图像)。

在网络上工作时,您一般如何处理此类情况? 有什么可能以某种方式为 Tensorflow 中的这个插件做好准备吗?

感谢您的帮助

K。

【问题讨论】:

  • 太棒了!!非常感谢@ThomasPinetz! (我的谷歌搜索没有输出这个;))会检查最适合我的女巫。
  • 虽然我不是 ML 专家,但我觉得这样做可能会适得其反。首先,如果重复项代表您的原始分布,则删除它们可能会使结果恶化;其次,在从图像数据集中学习时,通常会添加随机裁剪和变换的样本,以增加样本数量和鲁棒性。
  • 请注意,询问工具建议对于 SO 来说是题外话。您可能需要考虑编辑它。
  • @phg 它不代表原始分布。此外,在我的具体情况下,重要的是我的测试集将与训练中使用的任何数据完全断开。

标签: python image-processing tensorflow neural-network deep-learning


【解决方案1】:

似乎http://geeqie.sourceforge.net/ 正在做这个伎俩

感谢@ThomasPinetz

K.

【讨论】:

    【解决方案2】:

    你要做的事:

    将第一个图像添加到集合 (A),然后逐个解析剩余的图像,并仅将那些与 (A) 中的所有图像不同的图像添加到 (A)。继续迭代到最后一张图像。现在使用集合 (A) 图像进行训练和测试,比如 80% 的 (A) 用于训练,其余用于测试

    如何确定:冗余?

    简而言之,两个缩放的方形图像是相同的或多余的,因为它们都有四个直角(或特征)。如果一张正方形图像被裁剪,那么它也将至少有 2 个匹配的角(或匹配的特征)。

    因此,为了确定冗余图像,您需要找到图像的局部特征,然后计算有多少特征匹配。

    这可以通过SIFT(尺度不变特征变换)和SURF局部特征检测器等其他技术来实现。使用this文章了解基本情况。

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 2016-04-08
      • 2017-05-28
      • 1970-01-01
      • 2019-01-20
      • 2016-03-23
      • 2017-12-27
      • 2016-04-26
      相关资源
      最近更新 更多