【发布时间】:2015-12-09 17:34:21
【问题描述】:
我正在为捷克语单词执行 Bigram 生成。我能够使用 Python 生成 Bi-gram。问题在于捷克语中的非英文字符。
输入:
republikán strategy proti znovuzvolení Obamy。
执行Bigram,输出为
[['republik\xc3\xa1n', 'strategii'], ['strategii', 'proti'], ['proti', 'znovuzvolen\xc3\xad'], ['znovuzvolen\xc3 \xad', 'Obamy']]
捷克语的特殊字母在bigram中转换为\xc3\xad。 需要对代码进行哪些更改才能在输出中以正确的方式获取特殊字母
【问题讨论】:
标签: python non-ascii-characters n-gram non-english