【发布时间】:2021-06-09 19:57:25
【问题描述】:
我想根据短语长度对文本进行标记。
例如,构建一个函数process_text("Some text to be tokenized please", n = 3),其中n是短语长度,结果应该是这样的["Some text to","be tokenized please"]。
我该如何实现?
谢谢!
编辑:
好吧,也许我想出了一些可行的方法
from nltk import ngrams
def process_text(text, n = 1):
text= list(ngrams(text.split(), n))
tokenised=[" ".join(i) for i in text]
return tokenised
process_text("Some text to be tokenized please", n = 3)
【问题讨论】: