【发布时间】:2018-11-19 07:33:33
【问题描述】:
我有一个 unicode,例如“00C4”保存在一个数组中。我想替换一个占位符,例如文本中的“\A25”,其中包含仅具有 unicode 值的数组中的 unicode 的 ascii 值。我尝试了所有的编码、解码、原始字符串、unicode 字符串和带有转义符号“\”的不同设置。这里的问题是我不能在代码中写清楚的'\u1234',我必须使用数组值并将它与'\u'之类的东西结合起来。这是我当前的代码:
例如原型数组[i][1] = 00C4
例如原型数组[i][0] = A25
unicodeChar = u'\\u' + prototypeArray[i][1]
placeholder = '\\' + prototypeArray[i][0]
placeholder = u'' + placeholder
text = text.replace(placeholder,s)
目前它只是替换例如\A25 和 \u00C4 在文本中。 unicode 字符不会被这样解释。
【问题讨论】:
-
我认为您的意思是“Unicode 代码点”而不是“Unicode”。 ASCII 是 Unicode 编码的子集。 unicode 代码点并不总是有 ASCII 值。对于 U+007F 以上的 Unicode 点,您使用哪种编码方案? UTF-8?
-
是的,你是对的。我有一个 unicode 代码点并想将其转换为相关字符。 unicode 代码点仅保存为数组中没有 \u 的数字/字符串。然后我想在数字前面添加 \u,以便将字符解释为实际字符。编码为utf-8。
标签: regex python-3.x unicode type-conversion ascii