【发布时间】:2017-08-31 21:09:35
【问题描述】:
我在网页的 HTML 中有以下字符 —。它在网页上呈现为“—”(EM DASH)(如果需要,通过 Google Chrome 浏览器)。无论我如何使用文件编码(“utf-8”、“cp1251”、“cp866”),网页上始终是“—”。但是当我运行以下 python 代码时:
from HTMLParser import HTMLParser
h_parser = HTMLParser()
print h_parser.unescape('—')
它在unicode表中输出一些控制符号,即“保护区域结束”。
我应该使用什么 Python 代码从 — 字符串/unicode 字符串中获取“—”。我用python2.7
【问题讨论】:
标签: python html python-2.7 html-entities