【问题标题】:How to convert u'\x96' to u'–' in python如何在 python 中将 u'\x96' 转换为 u'–'
【发布时间】:2014-04-04 05:43:01
【问题描述】:

我正在将旧 Wordpress 博客中的内容移植到 Mezzanine。我得到了数据库的 json 转储,帖子中充斥着如下所示的特殊字符:\x96 以及其他未转义的 html。

如果我手动 replace 使用 &# 斜线并附加分号,则字符会正确呈现

所以\x96 到–

将 UTF-8(十六进制)转义为 HTML 实体(十六进制)

如何在 Python 中做到这一点?

【问题讨论】:

  • 必须是–吗?还是– 有效?如果是,u'\x96'.encode('ascii', 'xmlcharrefreplace') 可以解决问题。

标签: python html utf-8


【解决方案1】:

如果–也可以接受,可以使用:

>>> u'\x96'.encode('ascii', 'xmlcharrefreplace')
'–'

这甚至在documentation1中被调用。

1(虽然不是很清楚)...

【讨论】:

    猜你喜欢
    • 1970-01-01
    • 2014-07-21
    • 2016-12-12
    • 1970-01-01
    • 1970-01-01
    • 2015-06-30
    • 1970-01-01
    • 1970-01-01
    • 2017-02-16
    相关资源
    最近更新 更多