【问题标题】:multiclass prediction with text and numeric data使用文本和数字数据进行多类预测
【发布时间】:2018-03-24 23:39:00
【问题描述】:

我正在尝试为包含数字和文本特征的数据集创建预测模型(或分类) 使用 Tf-IdfVectorizer,我设法将文本列转换为列表 所以文本列中的每个单元格都是一个浮点数列表,例如 [0.0 0.3567 0.0 0.0](不带逗号)。 我的目标功能是一组类。每行可以有多个值,例如

[a, b, c, 1]
[1, d]
[]

问题是如何预处理目标变量,以便我的模型进行分类预测?我尝试了标签编码,但它为每一行创建了新的编码,因此相同的整数被编码到不同行的不同类。

我计划接受超过某个阈值的每一行的所有预测。是否有模型也支持这一点? 非常感谢提前

【问题讨论】:

  • 这是一个多标签分类问题。在目标上尝试MultilabelBinarizer,然后在支持它的use algorithms from here 上尝试。
  • @VivekKumar 那么我可以简单地将矩阵传递给分类器的 fit(x, y) 方法而不是一维列表吗? (作为 y 变量)
  • 是的,没错。请为 X 和 y 添加一些示例信息以及您的代码,我们可以为您提供一个工作示例。
  • 你好,我快要得到一些结果了,稍后我会发送一部分代码,这样会更有效率。谢谢

标签: pandas machine-learning scikit-learn multiclass-classification


【解决方案1】:

一种方法是针对每个标签单独训练分类器(每个样本是否具有特定标签将是二元分类)。另一个想法是将标签二值化并进行多类分类,但最后删除 softmax 函数(它将对数概率归一化为总和为 1)并为每个标签应用逻辑损失。

Keras 在这里会很容易使用。

【讨论】:

  • 我有大约 30 个标签,所以我猜它会非常昂贵。
  • @emrahozkan 它主要取决于您的算法和特征/样本的数量。 30 个目标变量根本不算多。
猜你喜欢
  • 1970-01-01
  • 1970-01-01
  • 2019-03-25
  • 2018-02-17
  • 2014-03-21
  • 2021-03-16
  • 2023-03-12
  • 2023-03-23
  • 2018-10-15
相关资源
最近更新 更多