【问题标题】:Training data for open nlp model - Outcome 1 and model not compatible with finder开放式 nlp 模型的训练数据 - 结果 1 和模型与 finder 不兼容
【发布时间】:2016-11-14 18:26:58
【问题描述】:

我目前在使用 opennlp 工具包训练新的 ner 模型时遇到问题。 我在网上找到了一个关于训练药物名称新模型的示例。 用于训练的样本数据如下所示

<START:medicine> Augmentin-Duo <END> is a penicillin antibiotic that contains two medicines - <START:medicine> amoxicillin trihydrate <END> and <START:medicine> potassium clavulanate <END>.

我正在尝试训练一个模型来识别物种名称,并设法创建了一个包含大约 35,000 个句子的样本数据集。 每个句子都包含至少一个我根据药物样本数据标记的物种名称。 看起来是这样的

A flatfish is a member of the order <START:sname> Pleuronectiformes </END> of ray-finned demersal fishes, also called the Heterosomata, sometimes classified as a suborder of Perciformes.

现在是有趣的部分。如果我开始培训,我会收到此消息

结果数:1

线程“主”java.lang.IllegalArgumentException 中的异常:模型与名称不兼容 发现者!

出于“测试”的目的,我在句子列表的开头复制了一个药物示例的句子,突然我得到“结果数:2”。

现在我不知道为什么我的样本只被认为是一种结果。 每个物种名称是否只允许在我的样本数据中出现一次?还有什么问题?我必须在一句话中标记至少 2 个物种名称吗? 不知道为什么我的代码适用于药物的示例数据而不适用于我的数据,希望有人可以在这里帮助我。

提前致谢!!

【问题讨论】:

    标签: opennlp


    【解决方案1】:

    这可能是因为您错误地标记了数据集。

    你已经完成了&lt;START:sname&gt; Pleuronectiformes &lt;/END&gt; 而不是&lt;START:sname&gt; Pleuronectiformes &lt;END&gt;

    / 可能就是这样,请确保您正确输入所有空格,并且每个句子都位于训练数据的一行中。

    如果这不起作用,请发布您的训练数据块。

    【讨论】:

    • 哇。我现在感到难以置信的愚蠢。谢谢你拯救了我的一天 - 再次!不敢相信我没看到……非常感谢!
    猜你喜欢
    • 2013-05-05
    • 2018-02-13
    • 2021-08-05
    • 2015-05-16
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多