【发布时间】:2013-08-14 19:22:49
【问题描述】:
这是我尝试标记希腊段落的代码的一部分。
doc = "Ο υπουργός Οικονομικών Γιάννης Στουρνάρας διαβίβασε την Τετάρτη στον πρόεδρο της αρμόδιας Αρχής κατά του ξεπλύµατος µαύρου χρήµατος, Παναγιώτη Νικολούδη, το αίτημα του υπουργού Υγείας Αδωνι Γεωργιάδη για κατά προτεραιότητα έλεγχο του «πόθεν έσχες» των διοικητών και υποδιοικητών που υπηρέτησαν στο Εθνικό Σύστημα Υγείας από το 2000 έως και σήμερα."
tokens = nltk.WordPunctTokenizer().tokenize(doc)
结果缺少几个单词,例如"Αρχής" 或"έσχες"。
如果我将这个在线工具用于相同的标记化模块,文字仍然存在。
到目前为止我所了解的是,在这段代码之后,我还有另一行删除了所有带有
如果我打印标记,例如单词"έσχες" 标记为["έ","σχ","ες"]。为什么这些词也被标记了?我认为这个模块将句子分成单词。
【问题讨论】: