【问题标题】:Named entity recognition with NLTK or Stanford NER using custom corpus使用自定义语料库使用 NLTK 或斯坦福 NER 进行命名实体识别
【发布时间】:2016-01-13 08:36:46
【问题描述】:

我正在尝试使用自定义 NE(命名实体)字典在 Indian 中训练 NER 模型以进行分块。我分别指的是 NLTK 和斯坦福 NER:

  1. NLTK

我发现nltk.chunk.named_entity.NEChunkParser nechunkparser 能够在自定义语料库上进行训练。但是,文档和源代码的注释中并没有说明训练语料的格式。

在哪里可以找到 NLTK 中 NER 自定义语料库的一些指南?

  1. 斯坦福 NER

根据question,斯坦福 NER 的常见问题解答提供了如何训练自定义 NER 模型的方向。

其中一个主要问题是默认的斯坦福 NER 不支持印度语。那么将印度 NER 语料库提供给模型是否可行?

【问题讨论】:

  • 只要训练语料库符合指定的格式,Stanford NER 就可以接受任何语言的训练。此外,NLTK 提供了一个很好的(尽管有些错误)界面来使用经过训练的斯坦福 NER 标记器。

标签: nlp stanford-nlp named-entity-recognition


【解决方案1】:

您的培训语料库需要使用.tsv 文件扩展名。

文件应该是这样的:

约翰 PER
作品O
在O
英特尔组织

这只是为了表示数据,因为我不知道您的目标是哪种印度语言。但您的数据必须始终是制表符分隔值。首先是令牌,另一个是与其关联的标签。

我通过构建我的自定义数据(虽然是英语)尝试了 NER,并构建了一个模型。

所以我猜这对于 印度 语言也很有可能。

【讨论】:

    猜你喜欢
    • 1970-01-01
    • 2015-02-22
    • 1970-01-01
    • 1970-01-01
    • 2012-11-25
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2017-12-09
    相关资源
    最近更新 更多