【发布时间】:2016-04-29 05:11:55
【问题描述】:
我正在使用 StanfordNER 分类器。有4个分类器作为
english.all.3class.distsim.crf.ser.gz
english.muc.7class.distsim.crf.ser.gz
english.conll.4class.distsim.crf.ser.gz
example.serialized.ncc.ncc.ser.gz
这些分类器是如何构建的?由于它们每个都基于不同的语料库,因此这是我的猜测
在语料库上训练一个机器学习分类器,如
SVM和OVR(用于多标签案例),以检测ORGANIZATION、PERSON、LOCATION等实体。这意味着训练数据将是语料库中文档的整个文本。对于那段文字,我们明确指出ORGANIZATIONs、PERSONs 和LOCATIONs。因此分类器将能够预测这些实体。训练机器学习分类器将 POS 标签与
ORGANIZATION、PERSON、LOCATION等实体联系起来。例如,可以训练分类器来预测哪些专有名词应该是ORGANIZATION
这是正确的大图吗?我只是想弄清楚如何构建自己的 NER。
【问题讨论】:
标签: machine-learning nlp classification stanford-nlp named-entity-recognition