【发布时间】:2018-02-11 18:26:59
【问题描述】:
我正在尝试实现卷积神经网络 (CNN) 模型来对手势进行分类。数据集不容易获得,因此我需要准备它。
我应该如何准备数据集?我拍摄的图像应该包含手以外的对象还是只包含手?尽管框架中有背景和其他物体,哪个会给我一个准确的模型?
【问题讨论】:
标签: machine-learning dataset conv-neural-network
我正在尝试实现卷积神经网络 (CNN) 模型来对手势进行分类。数据集不容易获得,因此我需要准备它。
我应该如何准备数据集?我拍摄的图像应该包含手以外的对象还是只包含手?尽管框架中有背景和其他物体,哪个会给我一个准确的模型?
【问题讨论】:
标签: machine-learning dataset conv-neural-network
这是一个例子: http://cims.nyu.edu/~tompson/NYU_Hand_Pose_Dataset.htm
它包含其他图像只是意味着你必须在你的管道中实现一些东西来隔离手。我建议只将手放在图像中,这样您就可以立即开始对图像进行建模。
该领域的许多 cnn 架构都使用多分辨率 CNN。因此,在您的数据准备中,只需制作多个分辨率并馈送到多输入 CNN。您可以使用 Keras 功能 API 来实现。低分辨率图像可以很好地区分某些非常不同的姿势,而高分辨率图像可以专注于微小的差异。
显然,标准数据增强不适用于手部姿势。镜像或更改角度之类的东西可能会使您的数据不适合给定的标签。因此,如果您没有那么多,请在数据扩充方面更加保守。
【讨论】: