【发布时间】:2016-11-14 18:26:58
【问题描述】:
我目前在使用 opennlp 工具包训练新的 ner 模型时遇到问题。 我在网上找到了一个关于训练药物名称新模型的示例。 用于训练的样本数据如下所示
<START:medicine> Augmentin-Duo <END> is a penicillin antibiotic that contains two medicines - <START:medicine> amoxicillin trihydrate <END> and <START:medicine> potassium clavulanate <END>.
我正在尝试训练一个模型来识别物种名称,并设法创建了一个包含大约 35,000 个句子的样本数据集。 每个句子都包含至少一个我根据药物样本数据标记的物种名称。 看起来是这样的
A flatfish is a member of the order <START:sname> Pleuronectiformes </END> of ray-finned demersal fishes, also called the Heterosomata, sometimes classified as a suborder of Perciformes.
现在是有趣的部分。如果我开始培训,我会收到此消息
结果数:1
线程“主”java.lang.IllegalArgumentException 中的异常:模型与名称不兼容 发现者!
出于“测试”的目的,我在句子列表的开头复制了一个药物示例的句子,突然我得到“结果数:2”。
现在我不知道为什么我的样本只被认为是一种结果。 每个物种名称是否只允许在我的样本数据中出现一次?还有什么问题?我必须在一句话中标记至少 2 个物种名称吗? 不知道为什么我的代码适用于药物的示例数据而不适用于我的数据,希望有人可以在这里帮助我。
提前致谢!!
【问题讨论】:
标签: opennlp