【发布时间】:2013-01-10 23:58:12
【问题描述】:
我基于 LingPipe DictionaryChunker 示例创建了一个测试程序。我正在从文件中将字典值读入 MapDictionary。当文件超过 100,000 个条目时,解析器开始返回垃圾:
对于 10k 行 (tail -10000 nameList.txt > shortNameList.txt)
TEXT=现在是所有好人来帮助他们国家的时候了 Zoe Rogers 现在是所有好人来帮助他们的国家的时候了
分块。所有匹配=false 区分大小写=false 短语=|佐伊·罗杰斯| start=69 end=79 type= PLAYER score=1.0
对于 100k 行(尾 -100000 nameList.txt > shortNameList.txt)
TEXT=现在是所有好人来帮助他们国家的时候了 Zoe Rogers 现在是所有好人来帮助他们的国家的时候了
分块。所有匹配=false 区分大小写=false 短语=|现在是所有好人的时候了|开始=0 结束=32 类型= 球员得分=1.0 短语=|来援助他们的国家|开始=33 结束=68 类型= 球员得分=1.0 短语=|佐伊·罗杰斯现在是时候了|开始=69 结束=103 类型= 球员得分=1.0 短语=|好人来相助| start=104 end=134 type= PLAYER score=1.0
创建 MapDictionary 有更好的选择吗?
我已经调整了 VM 上的内存限制,但这似乎没有帮助。
有什么想法吗?
【问题讨论】: