【发布时间】:2016-11-10 09:56:23
【问题描述】:
我正在使用scikit-learn 解决文本分类问题,我想知道是否有一种机器学习技术使用一对一、互斥的映射进行标记。
例如,假设我想根据它们所代表的城市来标记三个文档。我的品牌选择是纽约、底特律和洛杉矶。我的文件是“大苹果”、“大城市”和“天使之城”。对于这个例子,我们假设“天使之城”最接近洛杉矶,而“大苹果”和“大城市”都应该最接近纽约。但是,我想要一个映射到纽约(“大苹果”,因为让我们说它更合适),一个映射到底特律,因为纽约已经被使用过,而底特律是唯一剩下的选择,它仍然某种意义上是合适的。
我想告诉预测器,如果它使用了一个标签,它就不能再次使用它,所以它需要对该标签做出最好的猜测,因为它只能使用一次。
scikit-learn 或其他库是否具有像我想要的那样处理这种一对一(且只有一个)文本分类的功能?
【问题讨论】:
标签: machine-learning scikit-learn text-classification