【发布时间】:2017-08-02 16:00:22
【问题描述】:
我有这个训练和测试数据来预测测试数据的 Item_outlet_sales 的值。这是 train_data_df 和 test_data_df。
train_data_df
Item_Weight Item_Visibility Item_MRP Item_Outlet_Sales
Item_Identifier
FDA15 9.30 0.016047 249.8092 3735.1380
DRC01 5.92 0.019278 48.2692 443.4228
FDN15 17.50 0.016760 141.6180 2097.2700
FDX07 19.20 0.000000 182.0950 732.3800
NCD19 8.93 0.000000 53.8614 994.7052
Test_data_df
Item_Weight Item_Visibility Item_MRP
Item_Identifier
FDW58 20.750 0.007565 107.8622
FDW14 8.300 0.038428 87.3198
NCN55 14.600 0.099575 241.7538
FDQ58 7.315 0.015388 155.0340
FDY38 -999 0.118599 234.2300
我只包含了数字列并删除了不必要的列。
代码预测测试数据的值,但我对如何预测这些预测值的准确率、精度、召回率、f1 分数感到困惑。
import pandas as pd
import sklearn
import matplotlib.pyplot as plt
from sklearn import preprocessing,cross_validation, svm,neighbors
from sklearn.naive_bayes import GaussianNB
import numpy as np
from sklearn.metrics import accuracy_score, f1_score, precision_score, recall_score, classification_report, confusion_matrix,mean_squared_error
train_data_df= train_data_df.drop(['Item_Type','Outlet_Identifier','Item_Fat_Content','Outlet_Size','Outlet_Establishment_Year','Outlet_Location_Type','Outlet_Type','Item_Type'],axis=1)
test_data_df= test_data_df.drop(['Item_Type','Outlet_Identifier','Item_Fat_Content','Outlet_Size','Outlet_Location_Type','Outlet_Establishment_Year','Outlet_Type','Item_Type'],axis=1)
train_data_df.fillna(-999,inplace=True)
test_data_df.fillna(-999,inplace=True)
X = np.array(train_data_df.drop(['Item_Outlet_Sales'], axis=1 ),dtype=np.int64)
y= np.array(train_data_df['Item_Outlet_Sales'],dtype=np.int64)
test_data_df = np.array(test_data_df)
X_train,X_test,y_train,y_test_0= cross_validation.train_test_split(X,y,test_size=0.6665)
clf =neighbors.KNeighborsClassifier()
clf.fit(X_train,y_train)
test_data_predict = clf.predict(test_data_df)
print test_data_predict
现在我应该在 accuracy_score() 和其他分数中放入什么来计算。我猜一个是test_data_predict。我是否需要包括 cross_validation,因为我已经习惯了改进预测。
【问题讨论】:
-
test_data_df的Item_Outlet_Sales在哪里?
标签: python machine-learning scikit-learn classification evaluation