【问题标题】:MAXent classifier NLTK output understandMAXent分类器NLTK输出理解
【发布时间】:2013-04-22 10:08:22
【问题描述】:

我正在尝试了解 MAXent 分类器的 classifier.show_most_informative_features(10)。我不明白这些列的含义,例如在以下输出中:

train on 460 instances, test on 154 instances accuracy: 0.61038961039 
pos precision: 0.432989690722 
pos recall: 0.893617021277 
neg precision: 0.912280701754 
neg recall: 0.485981308411    
-4.141 need==True and label is 'REL'    
3.395 approves==True and label is 'IRREL'   -
3.308 took==True and label is 'IRREL' 
-1.766 treat==True and label is 'REL' 
-1.488 tired==True and label is 'IRREL' 
-1.295 gave==True and label is 'IRREL' 
0.879 need==True and label is 'IRREL' 

【问题讨论】:

  • 你能分享一下代码吗?你是如何产生所有的精度和召回值的?

标签: python machine-learning nltk text-classification


【解决方案1】:

您似乎有两个标签,"RELEVANT""IRRELEVANT"。当有两个标签时,一个通常命名为“1”或正,另一个命名为“-1”或负。

在训练过程中,分类器分析了 460 个训练实例的特征,并根据它们区分两个标签的能力对它们进行加权。加权过程的细节取决于您选择的算法。

正精度: 154 个在测试过程中被归类为标签 1 的测试实例中,有 43% 的真正具有标签 1。

正召回率: 89% 的标签 1 实例在测试集中被发现,即归类为标签 1。

负精度/负召回率是相同的,但标签为 -1。

准确性: 154 个测试实例中有 61% 被正确标记。

特征根据它们与分类的相关性相对应的绝对值进行排序。在这种情况下,最“有用”的特征是need,如果它是真的,这是一个很好的提示,即实例的标签应该是“RELEVANT”。

【讨论】:

  • 这很有用 - 但你能阐明 +ve 和 -ve 数字在特征排名中的意义吗?
  • 参考这篇文章,你就会明白为什么每个类都有+ve和-ve特性:nadesnotes.wordpress.com/2016/09/05/…
猜你喜欢
  • 1970-01-01
  • 1970-01-01
  • 2017-01-16
  • 2015-06-08
  • 1970-01-01
  • 1970-01-01
  • 2018-04-09
  • 2016-08-26
  • 2017-11-05
相关资源
最近更新 更多