【发布时间】:2017-07-18 18:50:25
【问题描述】:
该模型的目标是通过与视频输入相关联的词对视频输入进行分类。每个输入的维度为 45 帧、1 个灰色通道、100 个像素行和 150 个像素列(45、1、100、150),而每个对应的输出是 3 个可能单词之一的一个热编码表示(例如“是" => [0, 0, 1])。
模型编译过程中,出现如下错误:
ValueError: Dimensions must be equal, but are 1 and 3 for 'Conv2D_94' (op: 'Conv2D') with
input shapes: [?,100,150,1], [3,3,3,32].
这是用于训练模型的脚本:
video = Input(shape=(self.frames_per_sequence,
1,
self.rows,
self.columns))
cnn = InceptionV3(weights="imagenet",
include_top=False)
cnn.trainable = False
encoded_frames = TimeDistributed(cnn)(video)
encoded_vid = LSTM(256)(encoded_frames)
hidden_layer = Dense(output_dim=1024, activation="relu")(encoded_vid)
outputs = Dense(output_dim=class_count, activation="softmax")(hidden_layer)
osr = Model([video], outputs)
optimizer = Nadam(lr=0.002,
beta_1=0.9,
beta_2=0.999,
epsilon=1e-08,
schedule_decay=0.004)
osr.compile(loss="categorical_crossentropy",
optimizer=optimizer,
metrics=["categorical_accuracy"])
【问题讨论】:
-
@roganjosh 请查看更新后的问题。谢谢。
-
@roganjosh 你说删除回溯,所以我做了。
-
您误读了该评论。我的意思是“发布格式正确的回溯而不是图像”。我想不出删除跟踪可以提供帮助的任何情况。它不应该是裁剪的图像。抱歉,如果不清楚。
-
@roganjosh 明白了。我已经更新了问题
标签: python machine-learning deep-learning keras