【问题标题】:POS tagging - NLTK- Python词性标注 - NLTK - Python
【发布时间】:2015-09-15 01:47:38
【问题描述】:

我想使用word_tokenize, pos_tag, FreqDist。我不想默认下载所有nltk。我想使用nltk.download(info_or_id='')。我应该在info_or_id 中添加哪些选项来获取 POS 标记及其频率。 POS 标记 - Penn Treebank POS。

【问题讨论】:

  • POS 标记 - Penn Treebank POS”是什么意思?
  • 他的意思是词性 - 分析文本句子,例如动词/名词/副词。这是 Python NLTK(自然语言工具包,在你问之前)nltk.org 的功能之一。

标签: python nltk


【解决方案1】:

如果您查看语料库http://www.nltk.org/nltk_data/,每个描述都包含其 id,例如棕色,wordnet,book_grammars。您选择哪个取决于您的应用程序。查找标记的语料库,例如布朗包括 POS,我猜你必须查看每一个才能看到。 Treebank 提到了 Penn Treebank (id treebank),还有 Sinica Treebank (id sinica_treebank)。请参阅下面的标题 Parsed Corpora http://www.nltk.org/howto/corpus.html

【讨论】:

    【解决方案2】:

    您的问题将nltk 本身与nltk_data 混淆了。您不能真正只下载 nltk 的一部分(尽管如果需要节省空间,您可以小心地手动修剪它)。但我认为你试图避免下载所有的 nltk 数据。正如@barny 所写,当您打开交互式nltk.download() 窗口时,您可以看到不同资源的ID。

    1. 要使用 treebank pos 标注器,您需要它的腌制训练表(不是 treebank 语料库);您可以在 ID maxent_treebank_pos_tagger 下的“模型”选项卡中找到它们。 (因此:nltk.download("maxent_treebank_pos_tagger")

    2. FreqDist 类没有或不需要任何经过训练的模型。

    3. word_tokenize 也没有,它将一个句子作为单个字符串并将其分解为单词。但是,您可能需要sent_tokenize 的模型,它将较长的文本分解为句子。这由“Punkt”句子标记器处理,您可以使用nltk.download("punkt") 下载其模型。

    PS。对于一般用途,我建议下载“书”集合中的所有内容,即nltk.download("book")。它只是总数的一小部分,它可以让您完成大多数事情,而不会时常争先恐后地找出缺少的东西。

    【讨论】:

      猜你喜欢
      • 2012-11-11
      • 2015-02-20
      • 1970-01-01
      • 1970-01-01
      • 2015-11-13
      • 1970-01-01
      • 1970-01-01
      • 2015-08-29
      相关资源
      最近更新 更多