【发布时间】:2017-05-14 03:36:46
【问题描述】:
我想用新数据来训练 Chines Segenter,我生成了一个字典和一个序列化的树库文本文件。
我的问题是我不理解或找不到关于以下区别的文档:
-sighanCorporaDict 数据
和
-trainFile train.txt
谁能帮我解决这个问题。我的中文数据集是佛教古籍,很难替代-sighanCorporaDict之类的资源?
一切顺利
安德烈亚斯
【问题讨论】:
标签: stanford-nlp
我想用新数据来训练 Chines Segenter,我生成了一个字典和一个序列化的树库文本文件。
我的问题是我不理解或找不到关于以下区别的文档:
-sighanCorporaDict 数据
和
-trainFile train.txt
谁能帮我解决这个问题。我的中文数据集是佛教古籍,很难替代-sighanCorporaDict之类的资源?
一切顺利
安德烈亚斯
【问题讨论】:
标签: stanford-nlp
这里有训练你自己的中文分词器的文档:
https://nlp.stanford.edu/software/segmenter-faq.html
sighanCorporaDict 是一个包含分段器所需资源的目录...这应该设置为分段器分发中的data 目录
trainFile 应该是已正确分词的句子列表(单词以空格分隔)。
【讨论】: