【发布时间】:2023-03-22 02:25:01
【问题描述】:
最近我一直在尝试使用 Stanford Core NLP 训练 n-gram 实体。我遵循了以下教程 - http://nlp.stanford.edu/software/crf-faq.shtml#b
有了这个,我只能指定一元标记和它所属的类。任何人都可以指导我,以便我可以将其扩展到 n-gram。我正在尝试从聊天数据集中提取已知实体,例如电影名称。
请指导我,以防我误解了斯坦福教程,并且同样可以用于 n-gram 训练。
我坚持的是以下属性
#structure of your training file; this tells the classifier
#that the word is in column 0 and the correct answer is in
#column 1
map = word=0,answer=1
这里第一列是单词(unigram),第二列是实体,例如
CHAPTER O
I O
Emma PERS
Woodhouse PERS
现在我需要将 Hulk、Titanic 等已知实体(比如电影名称)训练为电影,使用这种方法会很容易。但是如果我需要训练我知道你去年夏天做了什么或婴儿节外出,最好的方法是什么?
【问题讨论】:
-
亲爱的@Arun,你成功地训练了 n-gram 的 NER 吗?我想培训教育,例如,理学硕士:教育,电子学博士:教育。你能指导我吗?谢谢
-
@KhalidUsman,感谢您与我们联系。我在下面的答案中使用了 LingPipe 来实现这一点。在相当数量的训练数据集上工作得很好。任何模型都可以正常工作,这取决于您提供的数据集的好坏程度。
标签: nlp stanford-nlp opennlp named-entity-recognition named-entity-extraction