【发布时间】:2020-02-02 13:48:28
【问题描述】:
我有一些利用十进制 NCR 对特殊字符进行编码的 html 文件(我将它们作为纯文本处理)。有没有办法使用 R 方便地将它们转换为 Unicode?
NCR 代码并不总是与 unicode 一对一匹配,而且会变得相当混乱,因为 ѣ 不等于 \u1123,而是等于 \u0463:
> stri_unescape_unicode("\u1123")
[1] "ᄣ"
和
> stri_unescape_unicode("\u0463")
[1] "ѣ"
【问题讨论】:
-
你见过This earlier post吗?