【发布时间】:2017-09-12 23:10:27
【问题描述】:
我想对包含子特征的数据集进行一些特征提取(或聚类)。 例如,数据集如下所示。目标是使用数据对机器人的类型进行分类。
Samples : 100 robot samples [Robot 1, Robot 2, ..., Robot 100]
Classes : 2 types [Type A, Type B]
Variables : 6 parts, and 3 sub-features for each parts (total 18 variables)
[Part1_weight, Part1_size, Part1_strength, ..., Part6_size, Part6_strength, Part6_weight]
我想用[重量、尺寸、强度]进行特征提取,并将提取的特征作为零件的代表值。
简而言之,我的目标是将特征减少到 6 个 - [Part1_total, Part2_total, ..., Part6_total] - 然后用这 6 个特征对机器人的类型进行分类。因此,将“重量”、“尺寸”和“强度”组合起来的特征是要解决的问题。
首先我想到了应用PCA(主成分分析),因为它是最流行的特征提取算法之一。但它会分别考虑所有 18 个特征,因此可以认为“Part1_weight”比“Part2_weight”更重要。但我要知道的是样本中“重量”、“尺寸”和“强度”的重要性,所以PCA似乎不适用。
有什么办法可以解决这个问题吗?
【问题讨论】:
标签: machine-learning pca feature-extraction feature-selection