【发布时间】:2018-03-24 23:39:00
【问题描述】:
我正在尝试为包含数字和文本特征的数据集创建预测模型(或分类)
使用 Tf-IdfVectorizer,我设法将文本列转换为列表
所以文本列中的每个单元格都是一个浮点数列表,例如
[0.0 0.3567 0.0 0.0](不带逗号)。
我的目标功能是一组类。每行可以有多个值,例如
[a, b, c, 1]
[1, d]
[]
问题是如何预处理目标变量,以便我的模型进行分类预测?我尝试了标签编码,但它为每一行创建了新的编码,因此相同的整数被编码到不同行的不同类。
我计划接受超过某个阈值的每一行的所有预测。是否有模型也支持这一点? 非常感谢提前
【问题讨论】:
-
这是一个多标签分类问题。在目标上尝试MultilabelBinarizer,然后在支持它的use algorithms from here 上尝试。
-
@VivekKumar 那么我可以简单地将矩阵传递给分类器的 fit(x, y) 方法而不是一维列表吗? (作为 y 变量)
-
是的,没错。请为 X 和 y 添加一些示例信息以及您的代码,我们可以为您提供一个工作示例。
-
你好,我快要得到一些结果了,稍后我会发送一部分代码,这样会更有效率。谢谢
标签: pandas machine-learning scikit-learn multiclass-classification