【发布时间】:2017-04-26 22:06:04
【问题描述】:
我目前在 unicode 字符串上使用正则表达式,但我只需要匹配 ASCII 字符,因此有效地忽略所有 unicode 字符,直到现在 regex.h 中的函数工作正常(我在 linux 上,所以编码是 utf8)。但是有人可以确认这样做是否真的可以吗?还是我需要一个 Unicode 上的正则表达式库(比如 ICU?)
【问题讨论】:
-
UTF-8 对非 ASCII 字符进行编码,使它们从不匹配 ASCII 字符,因此如果您搜索或匹配的只是这些字符,那么它应该是安全的.当然,既然我这么说了,就会有人过来告诉我我错了——我欢迎反例。