【发布时间】:2021-12-01 00:46:11
【问题描述】:
我有这个 KNN 代码,我想将它应用到我的数据框。它有 2 列:一列是 X,另一列是 Y。如何应用它?我需要把它们放在generate_data 吗?我不知道将它们连接起来。 (他们已经连接了吗?)
import pandas as pd
from pyod.models.knn import KNN
from pyod.utils.data import generate_data
from pyod.utils.data import evaluate_print
from pyod.utils.example import visualize
# Import data
AAPL= pd.read_csv('AAPL.csv', header=0, squeeze=True)
# Independent variables - Matrix
X = AAPL.iloc[:,1].squeeze()
# Dependent variables - vector
Y = AAPL.iloc[:,2].squeeze()
if __name__ == "__main__":
contamination = 0.1 # percentage of outliers
n_train = 200 # number of training points
n_test = 100 # number of testing points
# Generate sample data
X_train, y_train, X_test, y_test = \
generate_data(n_train=n_train,
n_test=n_test,
n_features=2,
contamination=contamination,
random_state=42)
# train kNN detector
clf_name = 'KNN'
clf = KNN()
clf.fit(X_train)
# get the prediction labels and outlier scores of the training data
y_train_pred = clf.labels_ # binary labels (0: inliers, 1: outliers)
y_train_scores = clf.decision_scores_ # raw outlier scores
# get the prediction on the test data
y_test_pred = clf.predict(X_test) # outlier labels (0 or 1)
y_test_scores = clf.decision_function(X_test) # outlier scores
# evaluate and print the results
print("\nOn Training Data:")
evaluate_print(clf_name, y_train, y_train_scores)
print("\nOn Test Data:")
evaluate_print(clf_name, y_test, y_test_scores)
# visualize the results
visualize(clf_name, X_train, y_train, X_test, y_test, y_train_pred,
y_test_pred, show_figure=True, save_figure=True)
【问题讨论】:
标签: pandas numpy machine-learning knn