【发布时间】:2015-04-14 10:41:01
【问题描述】:
我正在使用 Stanford CoreNLP for NER 来获取简短文档列表。
java -cp "*" -Xmx2g edu.stanford.nlp.pipeline.StanfordCoreNLP
-annotators tokenize,ssplit,pos,lemma,ner -ssplit.eolonly -pos.model edu/stanford/nlp/models/pos-tagger/english-caseless-left3words-distsim.tagger
-ner.model edu/stanford/nlp/models/ner/english.all.3class.caseless.distsim.crf.ser.gz
-file .../input -outputDirectory .../stanford_ner
问题是我从每个令牌中得到的CharacterOffsetBegin 和CharacterOffsetEnd 都是来自先前文档的连续数字。因此,例如 document_2 的第一个标记的 CharacterOffsetBegin 为 240 而不是 0。我可以在命令行中使用任何选项吗?任何帮助将不胜感激,谢谢!
【问题讨论】:
标签: nlp stanford-nlp named-entity-recognition