【问题标题】:text classification with machine learning使用机器学习进行文本分类
【发布时间】:2019-09-30 18:20:31
【问题描述】:

我有一个数据集,其中包含新闻标题和该新闻的类别。我希望我可以通过只输入标题来预测新闻的类别。 我需要能够对文本进行分类。 谢谢

【问题讨论】:

  • 我对python中的机器学习不是很熟悉,但是我使用weka来分析文本,我使用了一种称为string to vector的方法,它基本上根据某些单词的频率进行预测,我已经对这些词进行了词干化和标记化。

标签: python tensorflow machine-learning


【解决方案1】:

您的问题无法完全回答,但我可以给您一些起点。 , 你需要做一些自己的研究 本教程将是很好的开始。 link

对于本地开发,我建议将 Anaconda 用于库等和 Jupyter 笔记本。 或者 您可以使用 google colab 或 Microsoft Azure notebook。

  • 加载所需的库,
  • 加载数据、检查和清理数据
  • 为训练和测试拆分数据集
  • 将文本转换为矢量
  • 训练和测试模型并进行预测

还有一些帮助代码,

# Split-out validation dataset
X = df_row['tweets'].values
Y = df_row['label'].values
validation_size = 0.20
seed = 7
X_train, X_test, Y_train, Y_test = model_selection.train_test_split(X, Y, test_size=validation_size, random_state=seed)

vocab_size = 1000    
# define Tokenizer with Vocab Size
tokenizer = Tokenizer(num_words=vocab_size)
tokenizer.fit_on_texts(X_train)
#X_test and X_train are data tweets(text columns)
X_train = tokenizer.texts_to_matrix(X_train, mode='tfidf')
#X_train is now in vectorized form

【讨论】:

    猜你喜欢
    • 2018-08-15
    • 2020-05-29
    • 2017-12-18
    • 2018-03-05
    • 2015-01-16
    • 2020-02-08
    • 2021-06-17
    • 2019-01-27
    • 1970-01-01
    相关资源
    最近更新 更多