【发布时间】:2016-01-13 08:36:46
【问题描述】:
我正在尝试使用自定义 NE(命名实体)字典在 Indian 中训练 NER 模型以进行分块。我分别指的是 NLTK 和斯坦福 NER:
- NLTK
我发现nltk.chunk.named_entity.NEChunkParser nechunkparser 能够在自定义语料库上进行训练。但是,文档和源代码的注释中并没有说明训练语料的格式。
在哪里可以找到 NLTK 中 NER 自定义语料库的一些指南?
- 斯坦福 NER
根据question,斯坦福 NER 的常见问题解答提供了如何训练自定义 NER 模型的方向。
其中一个主要问题是默认的斯坦福 NER 不支持印度语。那么将印度 NER 语料库提供给模型是否可行?
【问题讨论】:
-
只要训练语料库符合指定的格式,Stanford NER 就可以接受任何语言的训练。此外,NLTK 提供了一个很好的(尽管有些错误)界面来使用经过训练的斯坦福 NER 标记器。
标签: nlp stanford-nlp named-entity-recognition