【发布时间】:2016-05-15 02:55:10
【问题描述】:
我正在解决一个分类问题。我为一组实体训练我的无监督神经网络(使用 skip-gram 架构)。
我评估的方式是为验证数据中的每个点搜索 k 个最近邻,来自训练数据。我取最近邻居标签的加权总和(基于距离的权重),并使用每个验证数据点的分数。
观察 - 随着我增加 epochs 的数量(model1 - 600 epochs,model 2- 1400 epochs 和 model 3 - 2000 epochs),我的 AUC 在更小的 @ 值处有所提高987654327@ 但在相似值处饱和。
对这种行为的可能解释是什么?
[Reposted 来自 CrossValidated]
【问题讨论】:
-
我正在尝试将客户评论分为两类。使用 sentence2vec 训练嵌入。我已经为 hadoop 编写了一个自定义的 kNN 分类器。
-
会不会只是两个类之间的可分离性不够?例如,如果这是某种类型的情感分析,那么我们经常会遇到双重否定表达式,这可能会扰乱一个幼稚的分类器。
-
如果
model3更擅长分类此类情况,那它的AUC 岂不是比model1更好? -
您的数据的总体规模是多少,这两个类别之间是否均衡?感觉model3在分类方面做得更好,这在k低时很明显。然而,所有模型都受益于具有较大 k 的倾斜/不平衡数据。我们可以排除这种情况吗?
-
@JohnWakefield 训练数据集大约有 50000 个示例,其中有大约 1200 个正例。偏度可以对所有模型在较大 k 处表现相似吗?在那种情况下,在这些 k 值下,结果不应该是最差的吗?
标签: neural-network classification deep-learning knn representation