【问题标题】:LingPipe dictionary sizeLingPipe 字典大小
【发布时间】:2013-01-10 23:58:12
【问题描述】:

我基于 LingPipe DictionaryChunker 示例创建了一个测试程序。我正在从文件中将字典值读入 MapDictionary。当文件超过 100,000 个条目时,解析器开始返回垃圾:

对于 10k 行 (tail -10000 nameList.txt > shortNameList.txt)

TEXT=现在是所有好人来帮助他们国家的时候了 Zoe Rogers 现在是所有好人来帮助他们的国家的时候了

分块。所有匹配=false 区分大小写=false 短语=|佐伊·罗杰斯| start=69 end=79 type= PLAYER score=1.0

对于 100k 行(尾 -100000 nameList.txt > shortNameList.txt)

TEXT=现在是所有好人来帮助他们国家的时候了 Zoe Rogers 现在是所有好人来帮助他们的国家的时候了

分块。所有匹配=false 区分大小写=false 短语=|现在是所有好人的时候了|开始=0 结束=32 类型= 球员得分=1.0 短语=|来援助他们的国家|开始=33 结束=68 类型= 球员得分=1.0 短语=|佐伊·罗杰斯现在是时候了|开始=69 结束=103 类型= 球员得分=1.0 短语=|好人来相助| start=104 end=134 type= PLAYER score=1.0

创建 MapDictionary 有更好的选择吗?

我已经调整了 VM 上的内存限制,但这似乎没有帮助。

有什么想法吗?

【问题讨论】:

    标签: java nlp


    【解决方案1】:

    事实证明,允许 MapDictionary 中的任何值为 null 会破坏分块器。删除任何具有空白值的行后,分块器工作正常。

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 1970-01-01
      • 2014-06-25
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 2010-10-14
      • 2015-05-15
      相关资源
      最近更新 更多