【发布时间】:2012-02-10 21:01:07
【问题描述】:
基于这篇文章:http://www.cise.ufl.edu/~ddd/cap6635/Fall-97/Short-papers/2.htm 我想构建决策树来对我的测试文档进行分类。
TRAIN SET
class1 中的文档:
document1 中的文本:中文 北京中文
document2 中的文本:Chinese Chinese Shanghai
document3 中的文本:澳门中文
class2 中的文件:
document4中的文字:东京日本中文
测试集(我必须决定下面的文档属于哪个类)
document5中的文字:Chinese Chinese Chinese Tokyo 日本 Pekin
首先,据我所知,我必须计算熵(S),因此:
熵(S) = - (|class1 中的文档| / |所有类中的文档|) * log2( |1 类中的文档| / |所有类中的文档|) - (|2 类中的文档| / |所有类中的文档|) * log2(|2 类中的文档| / |所有类中的文档|) = - (3/4 )log2(3/4) - (1/4)log2(1/4) = - 0.22 - (- 0.35) = 0.13
是吗?
根据这篇文章,我现在应该计算 Entropy(Sweak) 和 Entropy(Sstrong) - 但我应该计算什么?我有文档、单词和课程。
【问题讨论】:
标签: machine-learning