【发布时间】:2013-03-11 04:18:22
【问题描述】:
根据文档,我可以像这样在 nltk 中加载带有感觉标记的语料库:
>>> from nltk.corpus import wordnet_ic
>>> brown_ic = wordnet_ic.ic('ic-brown.dat')
>>> semcor_ic = wordnet_ic.ic('ic-semcor.dat')
我也可以得到definition、pos、offset、examples这样的:
>>> wn.synset('dog.n.01').examples
>>> wn.synset('dog.n.01').definition
但是如何从语料库中获取同义词集的频率? 分解问题:
- 首先如何计算一个同义词集在一个有义标签的语料库中出现的次数?
- 那么下一步是除以计数除以给定特定引理的所有同义词集出现的计数总数。
【问题讨论】:
-
在文档的引理部分,它显示了一些计数,但我不确定它们是什么nltk.googlecode.com/svn/trunk/doc/howto/wordnet.html
标签: python nlp nltk wordnet wsd