【发布时间】:2012-12-05 22:33:00
【问题描述】:
我的问题:如何训练只有正面和中性数据的分类器?
我正在构建一个用于教育目的的个性化文章推荐系统。我使用的数据来自 Instapaper。
数据集
我只有正面数据: - 我已阅读和“喜欢”的文章,无论已读/未读状态如何
还有中性数据(因为我已经表达了兴趣,但反正以后可能不喜欢了): - 未读的文章 - 我已阅读并标记为已读但我不“喜欢”的文章
我没有的数据是负数据: - 我没有发送到 Instapaper 稍后阅读的文章(我不感兴趣,虽然我浏览过那个页面/文章) - 我什至可能没有点击过的文章,但我可能有也可能没有存档。
我的问题
在这样的问题中,负数据基本上是缺失的。我想到了以下解决方案,但还没有解决:
1) 向分类器提供一些负面数据 优点:直接负数据来教分类器 缺点:随着我喜欢的文章数量的增加,对分类器的负面数据影响逐渐减弱
2) 把“中性”的数据变成负面的数据 优点:现在我拥有了我需要的所有正面和(新的)负面数据 缺点:尽管我对中性数据感兴趣,但我仍然希望获得有关此类文章的建议,但可能是价值较低的类别。
【问题讨论】:
-
你的分类特点是什么?
标签: machine-learning nlp recommendation-engine