【发布时间】:2019-03-12 20:27:29
【问题描述】:
这是我如何为我的语言(西班牙语)标记短语的示例。
texto= "esto es un texto, para el sr. gómez. Esto; es una prueba que puedes encontrar en www.google.com quisiera encontrarla.. claro esta,.Quisiera mejorarlo"
当我使用 nltk 标记我的短语时,这是输出:
['esto', 'es', 'un', 'texto', ',', 'para', 'el', 'sr.', 'gómez', '.', 'Esto', ';', 'es', 'una', 'prueba', 'que', 'puedes', 'encontrar', 'en', 'www.google.com','quiero','encontarla..','esta,.', 'quisiera','mejoralo']
除了sr. 或www.google.com 等有效分数外,我怎样才能消除标点符号
from nltk.tokenize import word_tokenize
texto= "esto es un texto, para el sr. gómez. Esto; es una prueba que puedes encontrar en www.google.com quisiera encontrarla.."
palabras_tokenizadas=(word_tokenize(texto,"spanish"))
print(palabras_tokenizadas)
这应该是结果:
['esto', 'es', 'un', 'texto', 'para', 'el', 'sr.', 'gómez', 'Esto', 'es', 'una', 'prueba', 'que', 'puedes', 'encontrar', 'en', 'www.google.com', 'quisiera', 'encontrarla', 'claro', 'esta', 'quisiera', 'mejorarlo']
我尝试过这样的事情,但它并没有解决我的问题(像"encontarla.."、"esta,." 这样的字眼的问题
punctuation = [",", ";", ".",...............] # The tokens that I want to skip
palabras_tokenizadas_1 = [ palabra for palabra in palabras_tokenizadas if palabra not in punctuation ]
我想用最好的方法在任何有分数的句子中全局解决我的问题,而不仅仅是解决这个句子的问题。怎么办?
【问题讨论】:
-
数字应该包含还是排除?以
'1995'为例。 -
包括在内,我认为
标签: python