【发布时间】:2020-08-30 03:22:03
【问题描述】:
我正在通过使用 crf 训练自定义模型进行一些测试,并且由于我没有适当的训练文件,我想自己制作一个包含 5 个标签和可能 10 个单词的列表,并且计划是以在未来使用更多传入数据不断改进模型。但是我得到的结果有很多误报(它标记了许多与训练文件中的原始单词无关的单词),因为创建的模型是概率性的,并且不仅仅考虑单独的单词
假设我想训练 corenlp 在不关心上下文的情况下检测一小部分单词,是否有一些特殊设置?如果没有,有没有办法计算需要多少数据才能获得准确的模型?
【问题讨论】:
标签: nlp stanford-nlp crf