【发布时间】:2020-07-05 04:37:24
【问题描述】:
我是 NLP 新手。 现在我正在尝试创建 NER 模型来从一些文本中提取音乐艺术家的名字。 但它并不顺利。这就是我所做的。
-
我得到了 1500,000 个艺术家的名单。
-
我使用字符串模板创建了训练数据。就像这样“{艺术家的名字}太恶心了。” 所有 1500,000 个训练数据都是这样的字符串。
TRAIN_DATA = [
("Nirvana is so sick", {"entities": [(0, 7, "ARTIST")]}),
("City girls is so sick", {"entities": [(0, 10, "ARTIST")]}),
("Taylor swift is so sick", {"entities": [(0, 12, "ARTIST")]}),
]
(也许这就是它不顺利的原因?)
-
我在训练了 30,000 个数据后使用了该模型。
-
但我根本没有工作。所有句子都被提取为 ARTIST。 下面是例子。在这种情况下,“克里斯·托马斯·金”是艺术家的名字。
Entities [('Not sure how they handled it during filming, but Tim Blake Nelson did sing his own parts (as did Chris Thomas King).', 'ARTIST')]
你有什么想法吗? 提前致谢。
【问题讨论】:
-
艺术家姓名的数量是否有限?还是您想要概括?
-
泛化比较好。但是看起来很难。我的计划是让模型学习有限的艺术家(1.5M)。然后它逐渐让模型学习一些额外的名称。
标签: nlp spacy training-data