【发布时间】:2021-09-27 19:28:29
【问题描述】:
我想在葡萄牙语的 SpaCy 模型中添加更多单词,以便我可以使用特定域的 PoS(词性),但我不想添加孤立的单词而是句子。我做了这三个步骤:
- 我将“PetroTok-UDPIPE.conllu”文件(在此处免费提供:http://petroles.ica.ele.puc-rio.br/,这是“PetroTok”文件的内部,包含带有各自 PoS 和引理的句子(不是单个单词))到二进制文件“PetroTok-UDPIPE.spacy”文件,使用以下命令(在 SpaCy 页面上显示:https://spacy.io/usage/training#data):
python -m spacy convert PetroTok-UDPIPE.conllu .
这创建了“PetroTok-UDPIPE.spacy”文件。
- 然后,我创建了“base_config.cfg”文件(如 SpaCy 页面所示:https://spacy.io/usage/training#quickstart):
将“train”和“dev”的值更改为:
train = "PetroTok-UDPIPE.spacy"
dev = "PetroTok-UDPIPE.spacy"
(在这种情况下,我考虑将相同的数据用于训练和验证,仅用于测试)。
拥有该文件后,我使用以下命令行创建“config.cfg”文件(也在 SpaCy 页面中指出:https://spacy.io/usage/training#quickstart):
python -m spacy init fill-config base_config.cfg config.cfg
- 我应用以下命令来创建模型(如 SpaCy 页面所示:https://spacy.io/usage/training#quickstart):
python -m spacy train config.cfg --output ./output
打印以下输出:
...当测试在粘贴“输出”中加载创建的模型的简单代码时,它会返回字符串“INTRODUÇÃO”的“.lemma_”和“.pos_”的空列表:
lemma = ['', '']
pos = ['', '']
您能帮我找出隐含的错误吗?我还有一个问题,以这种方式创建的模型仅使用“PetroTok-UDPIPE.conllu”文件创建,还是将元素合并到葡萄牙语模型中的模型(在这种情况下)?
谢谢。
【问题讨论】:
标签: python nlp spacy pos-tagger spacy-3