【问题标题】:Load classified data from CSV to Scikit-Learn for machine learning将分类数据从 CSV 加载到 Scikit-Learn 以进行机器学习
【发布时间】:2015-02-24 20:15:22
【问题描述】:

我正在学习 Scikit-Learn 对推文进行分类。我有一列上有推文的 csv,下一列中有从 0 到 11 的类别。我经历了this tutorial from Scikit-Learn site 我想我了解实际分类是如何完成的,但我认为我并不真正了解数据格式。在教程中,材料位于文件夹中的文件中,其中文件夹名称充当分类标签。

在我的情况下,我应该从 csv 文件中加载该数据,显然我需要构建数据结构,该数据结构手动提供给矢量化器和分类器。我应该如何处理这个?我认为本教程在这方面有点模棱两可,因为数据加载是自动完成的,让我对自定义数据的结构和加载一无所知。

【问题讨论】:

  • 您可能想查看pandas 文档。尤其是pandas.read_table 和pandas.read_csv 你可能会感兴趣。

标签: python csv machine-learning scikit-learn classification


【解决方案1】:

通常你会使用pandas.read_csv 或者如果你不想要pandas 依赖numpy.load 或者甚至使用标准库将cvs 加载到列表中。它看起来像这样:

import pandas as pd
from sklearn.feature_extraction.text import TfidfVectorizer

df = pd.read_csv('example.csv', header=None, sep=',', 
                 names=['tweets', 'class'])   # columns names if no header
vect = TfidfVectorizer()
X = vect.fit_transform(df['tweets']) 
y = df['class']

获得X 和y 后,您可以将它们提供给分类器。

【讨论】:

  • 谢谢!很高兴看到它毕竟是那么简单。有空的时候应该好好看看 Pandas。
猜你喜欢
  • 2015-07-18
  • 2020-12-10
  • 2017-08-22
  • 2018-04-23
  • 2020-10-26
  • 2019-04-16
  • 2018-07-07
  • 1970-01-01
  • 2020-04-17
相关资源
最近更新 更多