【发布时间】:2018-12-21 10:07:35
【问题描述】:
我是 Keras 的新手。刚从本地开始,取自here 的示例。示例数据工作正常。然后我稍微修改了代码以适应我的数据(在我的数据文件结果列中首先出现)。然后当我再次运行并尝试预测输入时,它总是为每个输入行返回相同的结果 - [1. 0.], [1. 0.] ...。这是我的代码:
import pandas as pd
from keras.models import Sequential
from keras.layers import Dense
from keras.callbacks import EarlyStopping
from keras.utils import to_categorical
#read in training data
train_df_2 = pd.read_csv('/Users/my_user/python-workspace/Deep-Learning-in-Keras-Tutorial/data/my_data.csv')
#view data structure
train_df_2.head()
#create a dataframe with all training data except the target column
train_X_2 = train_df_2.drop(columns=['result'])
target = train_df_2[['result']]
#check that the target variable has been removed
train_X_2.head()
#one-hot encode target column
train_y_2 = to_categorical(train_df_2.result)
#create model
model_2 = Sequential()
#get number of columns in training data
n_cols_2 = train_X_2.shape[1]
#add layers to model
model_2.add(Dense(25, activation='relu', input_shape=(n_cols_2,)))
model_2.add(Dense(25, activation='relu'))
model_2.add(Dense(2, activation='softmax'))
# model_2.add(Dense(10, input_dim=n_cols_2, kernel_initializer='normal', activation='relu'))
# model_2.add(Dense(25, activation='relu'))
# model_2.add(Dense(2, activation='softmax'))
#compile model using accuracy to measure model performance
model_2.compile(optimizer='adam', loss='categorical_crossentropy', metrics=['accuracy'])
#set early stopping monitor so the model stops training when it won't improve anymore
early_stopping_monitor = EarlyStopping(patience=3)
#train model
model_2.fit(train_X_2, train_y_2, epochs=30, validation_split=0.1, callbacks=[early_stopping_monitor])
p = model_2.predict(train_X_2, verbose=0, batch_size=1)
print(p)
我的输入数据示例:
result,i1,i2,i3,i4
0,1770,2390,1750,1816
1,1675,2540,2029,1940
1,1770,2384,1765,1770
0,1690,2485,2075,1900
0,1680,2465,2050,1920
0,1770,2395,1744,1795
1,1675,2490,2050,1915
0,1768,2400,1740,1790
0,1675,2525,2050,1910
.... (total 2312 rows)
为什么它总是为每一行返回相同的结果[1. 0.]?我预计至少有一排[0. 1.]。我做错了什么?
【问题讨论】:
-
我认为该模型过度拟合,因为您的 0 类的数据比 1 类的数据多?你能告诉我们每个类的数据数量吗?
-
考虑到您只有 4 列,我认为您使用的模型过于强大来预测结果。您应该尝试拟合一个简单的逻辑回归。当您的数据具有高度复杂性时,NN 非常有用。
-
@Vaibhavgusain 0/1 接近 50/50
-
如果
result只有2个值:0和1,你可以使用二进制输出格式。
标签: python tensorflow machine-learning keras neural-network