【发布时间】:2014-12-22 03:07:30
【问题描述】:
我正在使用Readability Parser API 从网页中提取内容。网页是拉丁字符集的时候没问题,但是当我用西里尔文提取文章时,它会出现以下内容:
<div>Ввоскресень</div>...etc
这里有趣的是,网页的标题在西里尔语中被正确提取,但内容却没有。我的尝试是按照SO answer 中的建议执行以下操作:
content = unicodedata.normalize('NFKD', content).encode('ascii','ignore')
但它不起作用。你能告诉我是否有办法在保存到数据库之前转换这个字符串?
如果我的问题标题正确解释了我的需求,请告诉我。谢谢。
【问题讨论】:
标签: python django unicode utf-8 python-unicode