【发布时间】:2011-12-27 03:29:59
【问题描述】:
我正在尝试预测传入网络数据包的到达间隔时间。我测量网络数据包的到达间隔时间并以二进制特征的形式表示此数据:xi= 0,1,1,1,0,... 其中 xi如果到达间隔时间小于收支平衡时间,则 em>=0,否则为 1。必须将数据映射到两个可能的类 C={0,1},其中 C=0 表示 短 到达间隔时间1 表示long 到达间隔时间。由于我想在在线特征中实现分类器,只要我观察到特征向量 xi=0,1,1,0...,我就会计算 MAP 类。由于我没有条件概率和先验概率的先验估计,我将它们初始化如下:
p(x=0|c=0)=p(x=1|c=0)=p(x=0|c=1)=p(x=1|c=1)=0.5
p(c=0)=p(c=1)=0.5
对于每个特征向量(x1=m1,x2=m2,...,xn=mn),当我输出一个类C时,我更新条件和先验概率如下:
p(xi=mi|y=c)=a+(1-a)*p(p(xi=mi|c)
p(y=c)=b+(1-b)*p(y=c)
问题是,我总是得到一个有偏见的预测。由于long的到达间隔次数比short要少,所以short的后总是保持不变高于long。有什么办法可以改善这一点吗?还是我做错了什么?任何帮助将不胜感激。
【问题讨论】:
标签: statistics machine-learning classification bayesian