【问题标题】:how to train large datasets with Stanford NER CFR如何使用斯坦福 NER CFR 训练大型数据集
【发布时间】:2016-03-10 18:38:40
【问题描述】:

我正在使用Stanford's NER CRF,并且想要训练一个大型数据集,比如说 10 万篇新闻文章。我如何训练数据,需要多长时间?我是机器学习领域的新手,希望得到一些指导。

问题 1: 所有这些变量是什么意思?我应该特别注意哪些?

numClasses: 8 numDocuments: 100 numDatums: 48721 numFeatures: 168489 Time to convert docs to data/labels: 1.0 seconds numWeights: 4317368 QNMinimizer called on double function of 4317368 variables, using M = 25.

问题 2:我应该在一台机器上运行训练,还是在分布式系统(如 Hadoop)上运行?

问题 3:计算似乎是 CPU 和内存密集型的,我该如何克服这些要求?

【问题讨论】:

    标签: hadoop machine-learning stanford-nlp


    【解决方案1】:
    • 您能否提供有关您的训练数据的更多详细信息。通常你会在人工标记数据上训练 NER 系统,例如 2003 CoNLL 数据集。你有多少人工标记的数据?

    • NER 系统的常见问题解答对减少内存有一些建议:

      http://nlp.stanford.edu/software/crf-faq.shtml#d

    • 目前没有在多台机器上运行 NER 训练的选项。

    • 我对此并不肯定,但我认为默认情况下,CRFClassifier 在评估渐变时将使用多线程...如果它不使用多线程,将以下内容添加到您的属性应该会导致它开始使用指定线程数的多线程:

      multiThreadGrad=4
      

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 2017-11-27
      • 2023-03-22
      • 2020-08-30
      • 1970-01-01
      • 1970-01-01
      相关资源
      最近更新 更多