【发布时间】:2017-02-17 02:30:21
【问题描述】:
如何转换如下数据格式:
James Smith was born on November 17, 1948
变成类似
("James Smith", DOB, "November 17, 1948")
不必依赖字符串的位置索引
我已经尝试了以下
from nltk import word_tokenize, pos_tag
new = "James Smith was born on November 17, 1948"
sentences = word_tokenize(new)
sentences = pos_tag(sentences)
grammar = "Chunk: {<NNP*><NNP*>}"
cp = nltk.RegexpParser(grammar)
result = cp.parse(sentences)
print(result)
如何进一步获得所需 fromat 的输出。
【问题讨论】:
标签: python python-3.x nltk stanford-nlp information-retrieval