【发布时间】:2016-05-17 22:26:43
【问题描述】:
我有兴趣使用自己的数据集训练新的情绪模型。我知道我需要创建一个带有情感标签的文件,用于标记句子及其组成短语和单词。
我想出了如何为“我不爱你”这句话创建如下所示的树。通过 BuildBinarizedDataset:
(1 (1 I) (1 (1 (1 (1 do) (1 not)) (1 (1 love) (1 you))) (1 .)))
但是,以这种格式手动添加标签似乎非常困难,尤其是对于较长句子中的短语。如果我可以为标记目的生成以下内容,然后在我准备好训练新模型时进行转换,那会容易得多。
sentiment_score pline1
sentiment_score phrase1
sentiment_score phrase2
...........................
sentiment_score phraseN
BLANK ROW
sentiment_score pline2
问题是我无法弄清楚如何使用解析器从句子中生成它。如果有人可以提供指导,或将我引导到可以解释此过程的文档,那将极大地帮助我。
【问题讨论】:
-
您不能为您的训练数据集生成标签,您必须手动提供标签才能相应地
train您的模型。
标签: nlp stanford-nlp