【发布时间】:2013-03-25 22:16:10
【问题描述】:
我正在尝试抓取存在 unicode 字符的网站。我在一开始就声明了-*- coding: utf-8 -*- 加上我使用了re.UNICODE 标志
pattern = re.compile('(?:{}|{})'.format(regex, regex1), re.UNICODE)
但是,当我打印输出时,我仍然会得到那些奇怪的字符,例如 �
我该如何解决这个问题?谢谢!
【问题讨论】:
-
您可能会因为您的字体不支持相应的 Unicode 字符而得到 � 字形。
-
百分百。
-
您必须先从网站解码 UTF-8 文本。例如,请参阅this question。
标签: python regex unicode python-2.7