【发布时间】:2018-08-01 05:01:36
【问题描述】:
【问题讨论】:
【问题讨论】:
您在这里要解决的是集群识别问题。您在问题中描述的 100-1000 张图像都是未标记数据集的大型集群。有多种聚类识别算法在您的情况下是完美的,例如 k-means 算法、k-modes 算法或 k-Nearest Neighbor 算法。
基本上,数据聚类的工作原理是,它们根据集群的大小、密度、距离、形状等多个相似性特征将相似的集群统计地分类为类,从而形成一组相似和不相似的集群。使用聚类算法,您的机器可以通过观察您打算提供给它的尽可能多的数据集来学习识别模式。
现在,当您缩放图像或旋转/裁剪图像时,您只会增加数据集中的噪点。噪声使数据聚类过程更加繁琐,但它是可行的。想了解更多数据聚类算法,可以参考这个paper。
【讨论】: