【发布时间】:2018-05-20 05:10:51
【问题描述】:
我有一个网球运动员的名字,显然它没有被 pandas 正确解析。它是“radwa?ska”。我有两个函数,我使用word_tokenize() 函数进行标记。
它在两个不同的函数中以两种不同的方式对句子进行标记。如何让第二个走第一个方向['radwa?ska']['radwa','?','ska']
这是两个函数中的代码。
第一个函数:word_tokenize(keyword)关键字是'martina hingis, nadia petrova, agnieszka radwa?ska'
在第二个函数中是:word_tokenize(content[j]) where content[j] is 'agnieszka radwa?ska'
.
【问题讨论】:
标签: python encoding utf-8 tokenize python-unicode