【发布时间】:2016-02-16 05:14:22
【问题描述】:
我一直在与斯坦福大学的 coreNLP 合作,对我拥有的一些数据进行情感分析,并且我正在努力创建一个训练模型。我知道我们可以使用以下命令创建一个训练模型:
java -mx8g edu.stanford.nlp.sentiment.SentimentTraining -numHid 25 -trainPath train.txt -devPath dev.txt -train -model model.ser.gz
我知道 train.txt 文件中的内容。您对句子进行评分并将它们放入 train.txt,如下所示:
(0 (2 Today) (0 (0 (2 is) (0 (2 a) (0 (0 bad) (2 day)))) (..)))
但我不明白 dev.txt 文件中的内容。 我多次阅读this 问题,试图了解dev.txt 中的内容,但我仍然不清楚。此外,手动对这些句子进行评分变得很痛苦,是否有可用的工具使其变得更容易?我担心我一直在使用错误数量的括号或其他类似的愚蠢错误。
另外,关于我的 train.txt 文件应该多长的任何建议?我想给1000个句子打分。这个数字是不是太小了,太大了?
感谢您的所有帮助:)
【问题讨论】:
标签: stanford-nlp sentiment-analysis training-data scoring