【问题标题】:Evaluating performance of Neural Network embeddings in kNN classifier在 kNN 分类器中评估神经网络嵌入的性能
【发布时间】:2016-05-15 02:55:10
【问题描述】:

我正在解决一个分类问题。我为一组实体训练我的无监督神经网络(使用 skip-gram 架构)。

我评估的方式是为验证数据中的每个点搜索 k 个最近邻来自训练数据。我取最近邻居标签的加权总和(基于距离的权重),并使用每个验证数据点的分数。

观察 - 随着我增加 epochs 的数量(model1 - 600 epochs,model 2- 1400 epochs 和 model 3 - 2000 epochs),我的 AUC 在更小的 @ 值处有所提高987654327@ 但在相似值处饱和。

对这种行为的可能解释是什么?

[Reposted 来自 CrossValidated]

【问题讨论】:

  • 我正在尝试将客户评论分为两类。使用 sentence2vec 训练嵌入。我已经为 hadoop 编写了一个自定义的 kNN 分类器。
  • 会不会只是两个类之间的可分离性不够?例如,如果这是某种类型的情感分析,那么我们经常会遇到双重否定表达式,这可能会扰乱一个幼稚的分类器。
  • 如果model3 更擅长分类此类情况,那它的AUC 岂不是比model1 更好?
  • 您的数据的总体规模是多少,这两个类别之间是否均衡?感觉model3在分类方面做得更好,这在k低时很明显。然而,所有模型都受益于具有较大 k 的倾斜/不平衡数据。我们可以排除这种情况吗?
  • @JohnWakefield 训练数据集大约有 50000 个示例,其中有大约 1200 个正例。偏度可以对所有模型在较大 k 处表现相似吗?在那种情况下,在这些 k 值下,结果不应该是最差的吗?

标签: neural-network classification deep-learning knn representation


【解决方案1】:

要交叉检查不平衡类是否是一个问题,请尝试拟合 SVM 模型。如果这给出了更好的分类(如果您的 ANN 不是很深,则可能),则可以得出结论,应该首先平衡类。

另外,尝试一些核函数来检查这种转换是否使数据线性可分?

【讨论】:

    猜你喜欢
    • 2019-11-17
    • 2018-04-30
    • 2013-06-30
    • 2016-11-04
    • 2019-11-26
    • 2012-10-08
    • 1970-01-01
    • 2017-04-13
    • 2020-03-07
    相关资源
    最近更新 更多