【问题标题】:Dealing with Cyrillic alphabet used in place of Latin characters处理用于代替拉丁字符的西里尔字母
【发布时间】:2012-09-03 10:17:40
【问题描述】:

我们最近有一个用户输入英文文本,但它似乎是在为西里尔文设置的计算机上完成的,因为“a”等一些字母实际上是西里尔小写字母 A,而不是拉丁小写字母字母 A。

我认为normalising 会将西里尔字母转换为等价的拉丁文,但事实并非如此(我猜它们只是在显示方式上相同,而不是在含义上)。

这是一个常见问题吗 - 为西里尔文设置计算机的用户可能正在写英文,但使用的是西里尔字母?

一般来说,什么是发现这一点并进行适当转换的安全方法?

【问题讨论】:

    标签: utf-8 utf


    【解决方案1】:

    要检测西里尔字母,只需使用正则表达式匹配 [\p{IsCyrillic}]。更通用的方法是搜索任何非拉丁字符。 找到匹配的字符,您需要将字符替换为对应的拉丁文字符。

    【讨论】:

      猜你喜欢
      • 2017-06-19
      • 2017-01-01
      • 1970-01-01
      • 2013-10-21
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      相关资源
      最近更新 更多