【问题标题】:POS tagging in nltknltk中的POS标记
【发布时间】:2014-09-10 00:00:51
【问题描述】:

嗨,有没有一种有效的方法可以在非常大的文件中标记词性?

 import pandas as pd
 import collections 
 import nltk 

 tokens=nltk.word_tokenize(pandas_dataframe)
 tag1=nltk.pos_tag(tokens)
 counts=collections.counter([y for x,y  in tag1])

我正在尝试在文件中查找最常见的词性,但不知道有更好的方法

【问题讨论】:

    标签: python text nltk


    【解决方案1】:

    通常您需要避开 for 循环、可能的高内存负载和可能的高 CPU 负载。

    这是一个使用 python 和 execnet 的 distributed part of speech tagging 示例。

    【讨论】:

      猜你喜欢
      • 2016-07-02
      • 2015-03-25
      • 2013-01-08
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 2013-06-20
      • 2013-12-18
      相关资源
      最近更新 更多