【发布时间】:2018-03-08 17:23:15
【问题描述】:
详细说明:在什么情况下微调小型网络(例如 SqueezeNet)的所有层会比特征提取或仅微调大型网络的最后 1 或 2 个卷积层(例如 inceptionV4)表现更好?
我的理解是两者所需的计算资源有点可比。我记得在paper 中读到过极端选项,即微调 90% 或 10% 的网络比 50% 等更温和的选项要好得多。那么,在无法进行广泛试验时,默认选择应该是什么?
任何过去的实验和对其结果的直观描述、研究论文或博客都会特别有帮助。谢谢。
【问题讨论】:
标签: tensorflow computer-vision deep-learning conv-neural-network