【发布时间】:2023-04-09 02:13:01
【问题描述】:
我整天都在为此工作(相当挣扎)。阅读了文档、许多其他教程后,由于我缺乏经验,我无法弄清楚如何将自己的数据与 MultinomialNB 分类器一起使用?
这是主要教程中的代码:
from sklearn.datasets import fetch_20newsgroups
from sklearn.naive_bayes import MultinomialNB
categories = ['alt.atheism', 'soc.religion.christian',
'comp.graphics', 'sci.med']
text_clf = Pipeline([('vect', CountVectorizer()),
('tfidf', TfidfTransformer()),
('clf', MultinomialNB()),
])
twenty_train = fetch_20newsgroups(subset='train',
categories=categories, shuffle=True, random_state=42)
text_clf.fit(twenty_train.data, twenty_train.target)
docs_test = ['Graphics is love', 'the brain is part of the body']
predicted = text_clf.predict(docs_test)
for doc, category in zip(docs_test, predicted):
print('%r => %s' % (doc, twenty_train.target_names[category]))
显然,它有效。但是如何用我自己的数据(存储在 python 字典等中)替换 fetch_20newsgroups?而下面训练数据中的每一项都归为一类,这是如何实现的?
我明白这不是一个好问题,但在这个需要的时候,我只是想了解它是如何工作的。谢谢
【问题讨论】:
标签: python scikit-learn training-data