【发布时间】:2012-02-15 09:38:28
【问题描述】:
我有一个非常糟糕的文件,里面充满了我正在尝试清理的 unicode 字节。该文件中的一些示例如下:
ブラック
roler coaster
digital social party
big bellie
cornacopia
\xd0\xb7\xd1\x83\xd0\xb1\xd0\xbd\xd0\xb0\xd1\x8f \xd1\x89\xd0\xb5\xd1\x82\xd0\xba\xd0\xb0
现在,我想做的是将所有那些丑陋的字节点转换为真正的 unicode 文本。因此,以上内容将输出为:
ブラック
roler coaster
digital social party
big bellie
cornacopia
зубная щетка
一个小时以来,我一直在思考如何在 Perl 中执行此操作,但我没有好主意。如果你有的话,我很想听听。
【问题讨论】:
-
“unicode 字节”是什么意思? “cornacopia”(拼写为“cornucopia”,顺便说一句)后面的行是否实际上包含反斜杠字符?你想生成什么样的“真正的 unicode 文本”(UTF-8?UTF-16?还有什么?)
-
是的,它有反斜杠。我准确地粘贴了文件中的内容。这也是“cornacopia”拼写错误的原因。我只想将其转换为 utf8。