【发布时间】:2017-03-03 12:12:48
【问题描述】:
因此,我已将推文标记为已转发或未转发,我必须使用逻辑回归构建模型来预测推文是否会被转发。
我面临的问题是我不知道如何使用逻辑回归的多重特征。我必须使用的功能是 tf-idf、lda、一条推文是否被转发、某个用户的推文过去被转发了多少次。
如何在二元分类中使用 4 个特征?任何帮助将不胜感激。
【问题讨论】:
-
您使用哪个工具来解决这个问题(scikit-learn、tensorflow ...)?使用 2 个特征的过程与使用 4 个特征的过程相同,没有区别。
-
scikit 学习。我们将如何去做?有参考教程吗?
-
你能分享一个你的数据集的小例子吗?这样我可以提供更好的帮助
-
当然。我有大量关于一条推文是否被转发的标签推文。我必须对推文是否会被转发进行二进制分类。为此,我必须使用多个特征,即特定用户的推文总数、tf-idf 分数等等。我怎样才能整合所有这些功能。现在,我正在对 tf idf 分数进行分析。
-
嗨,我的意思是你的数据集的例子,就像一个小例子表,例如,如果你有你的特征: tf-idf , feature2 , feature3 ,你的目标是“转推”,你将需要 2 个 numpy 结构:一个带有您的特征(每个观察一行,每个特征一列),另一个带有输出的向量(例如 1= 转推,0 = 不转推)。完成后,您实例化一个 LogisticRegression 对象,并在其上调用“fit”。我无法在评论中发布代码,因此我将在新答案中发布此代码)
标签: machine-learning text-classification