【问题标题】:How to use multiple features for text in text classification?如何在文本分类中对文本使用多个特征?
【发布时间】:2017-03-03 12:12:48
【问题描述】:

因此,我已将推文标记为已转发或未转发,我必须使用逻辑回归构建模型来预测推文是否会被转发。

我面临的问题是我不知道如何使用逻辑回归的多重特征。我必须使用的功能是 tf-idf、lda、一条推文是否被转发、某个用户的推文过去被转发了多少次。

如何在二元分类中使用 4 个特征?任何帮助将不胜感激。

【问题讨论】:

  • 您使用哪个工具来解决这个问题(scikit-learn、tensorflow ...)?使用 2 个特征的过程与使用 4 个特征的过程相同,没有区别。
  • scikit 学习。我们将如何去做?有参考教程吗?
  • 你能分享一个你的数据集的小例子吗?这样我可以提供更好的帮助
  • 当然。我有大量关于一条推文是否被转发的标签推文。我必须对推文是否会被转发进行二进制分类。为此,我必须使用多个特征,即特定用户的推文总数、tf-idf 分数等等。我怎样才能整合所有这些功能。现在,我正在对 tf idf 分数进行分析。
  • 嗨,我的意思是你的数据集的例子,就像一个小例子表,例如,如果你有你的特征: tf-idf , feature2 , feature3 ,你的目标是“转推”,你将需要 2 个 numpy 结构:一个带有您的特征(每个观察一行,每个特征一列),另一个带有输出的向量(例如 1= 转推,0 = 不转推)。完成后,您实例化一个 LogisticRegression 对象,并在其上调用“fit”。我无法在评论中发布代码,因此我将在新答案中发布此代码)

标签: machine-learning text-classification


【解决方案1】:

这里只是一个使用 clasiffier 默认参数的例子,想法是如果你有两个,或者如果你有更多的特性,则使用相同的过程:

dataset = np.ndarray(shape=(num_rows,3),dtype=np.float32) ;
retweeted_output = np.ndarray(shape=(num_rows,1),dtype=np.float32)
#perform some actions to fill your data structures
model = LogisticRegression(); 
model.fit(dataset,retweeted_output);

【讨论】:

  • 这很棒。非常感谢。
猜你喜欢
  • 2020-09-10
  • 1970-01-01
  • 2020-11-29
  • 2019-06-30
  • 2019-06-04
  • 2015-04-23
  • 2015-12-13
  • 2019-07-25
  • 2019-05-24
相关资源
最近更新 更多