【发布时间】:2019-06-27 12:18:52
【问题描述】:
我正在尝试实现this approach 用于物体检测和跟踪。而且我无法将注意力集中在细节上。我试图寻找这篇文章的评论和解释。我不明白的是:
对于时间信息,我们从过去 5 个时间戳中获取所有 3D 点。因此,我们的输入是由时间、高度、X 和 Y 组成的 4 维张量。对于我们的早期融合和晚期融合模型,我们使用 Adam 优化器从头开始训练,学习率为 1e-4。该模型在 4 Titan XP GPU 服务器上进行训练,批量大小为 12
我知道一个CNN输入如下
[batch_size, 通道, X, Y]
但这里他们正在考虑
[时间、频道、X、Y]
然后他们提到批量大小是 12!我不明白的是他们在哪里考虑 batch_size 以及它代表 5 个时间戳。
希望有人能提供见解。
由于他们的数据集不是开源的,我正在研究 KITTI 跟踪基准。
【问题讨论】:
标签: python tensorflow deep-learning conv-neural-network