【发布时间】:2016-03-10 18:38:40
【问题描述】:
我正在使用Stanford's NER CRF,并且想要训练一个大型数据集,比如说 10 万篇新闻文章。我如何训练数据,需要多长时间?我是机器学习领域的新手,希望得到一些指导。
问题 1: 所有这些变量是什么意思?我应该特别注意哪些?
numClasses: 8
numDocuments: 100
numDatums: 48721
numFeatures: 168489
Time to convert docs to data/labels: 1.0 seconds
numWeights: 4317368
QNMinimizer called on double function of 4317368 variables, using M = 25.
问题 2:我应该在一台机器上运行训练,还是在分布式系统(如 Hadoop)上运行?
问题 3:计算似乎是 CPU 和内存密集型的,我该如何克服这些要求?
【问题讨论】:
标签: hadoop machine-learning stanford-nlp