【问题标题】:How are StanfordNER Classifiers builtStanfordNER 分类器是如何构建的
【发布时间】:2016-04-29 05:11:55
【问题描述】:

我正在使用 StanfordNER 分类器。有4个分类器作为

english.all.3class.distsim.crf.ser.gz
english.muc.7class.distsim.crf.ser.gz
english.conll.4class.distsim.crf.ser.gz
example.serialized.ncc.ncc.ser.gz

这些分类器是如何构建的?由于它们每个都基于不同的语料库,因此这是我的猜测

  1. 在语料库上训练一个机器学习分类器,如SVMOVR(用于多标签案例),以检测ORGANIZATIONPERSONLOCATION 等实体。这意味着训练数据将是语料库中文档的整个文本。对于那段文字,我们明确指出ORGANIZATIONs、PERSONs 和LOCATIONs。因此分类器将能够预测这些实体。

  2. 训练机器学习分类器将 POS 标签与ORGANIZATIONPERSONLOCATION 等实体联系起来。例如,可以训练分类器来预测哪些专有名词应该是ORGANIZATION

这是正确的大图吗?我只是想弄清楚如何构建自己的 NER。

【问题讨论】:

    标签: machine-learning nlp classification stanford-nlp named-entity-recognition


    【解决方案1】:

    是的,模型是根据监督数据进行训练的。它们是执行多类概率序列分类的一阶 CRF(所以不是 OVR,不是 SVM)。你可以在the Stanford NER page 上找到关于 NER 和斯坦福 NER 的介绍。

    【讨论】:

    • 感谢@Christopher Manning。快速跟进,conll 分类器基于哪个版本的 conll?我的意思是它基于 CoNLL-2003 共享任务吗?我知道 CoNLL-2000 共享任务是基于路透社数据的。 english.conll.4class.distsim.crf.ser.gz的基础是什么数据集? english.muc.7class.distsim.crf.ser.gz 同样如此
    • CoNLL 2003 共享任务。同样基于路透社数据
    猜你喜欢
    • 1970-01-01
    • 2017-04-12
    • 1970-01-01
    • 2019-08-29
    • 2023-03-15
    • 2016-05-26
    • 2018-04-04
    • 2020-06-30
    • 2018-12-29
    相关资源
    最近更新 更多