【问题标题】:Train Chinese Segmenter with custom sources使用自定义来源训练中文分词器
【发布时间】:2017-05-14 03:36:46
【问题描述】:

我想用新数据来训练 Chines Segenter,我生成了一个字典和一个序列化的树库文本文件。

我的问题是我不理解或找不到关于以下区别的文档:

-sighanCorporaDict 数据

-trainFile train.txt

谁能帮我解决这个问题。我的中文数据集是佛教古籍,很难替代-sighanCorporaDict之类的资源?

一切顺利

安德烈亚斯

【问题讨论】:

    标签: stanford-nlp


    【解决方案1】:

    这里有训练你自己的中文分词器的文档:

    https://nlp.stanford.edu/software/segmenter-faq.html

    sighanCorporaDict 是一个包含分段器所需资源的目录...这应该设置为分段器分发中的data 目录

    trainFile 应该是已正确分词的句子列表(单词以空格分隔)。

    【讨论】:

    • 很遗憾这个页面没有解释参数。我认为参数 -serDictionary 是我必须提前准备的已知单词的列表。 -serDictionary 和基本上是一个目录的 -sighanCorporaDict 有什么区别?
    • 我错了。分段器分发中有一个数据目录。您可以在此处下载文件夹:nlp.stanford.edu/software/segmenter.shtml ...在下载的文件夹中有一个名为 data 的目录,这就是您要为 sighanCorporaDict 设置放置的目录。如果您查看代码,您会看到它试图从 sighanCorporaDict+"dict/" 获取资源......所以代码主要使用诸如“data/dict/pku.non”和“data/dict/ctb.non”之类的东西等等……
    • 但是为什么呢?目录的目的是什么?
    • 数据目录包含一个 dict 目录,其中包含分段器使用的文件,例如 pku.non...我不确定这些文件的用途,但它们是某些功能的资源。在训练代码的某个地方,当它尝试评估特征值时,它会加载该文件并对其进行处理。
    • 只是为了澄清 pku.non 不是已知单词的列表,它是训练过程的一些补充资源。
    猜你喜欢
    • 2020-09-07
    • 1970-01-01
    • 1970-01-01
    • 2023-04-09
    • 2018-07-04
    • 2022-10-08
    • 2017-10-09
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多