【发布时间】:2016-11-27 17:40:07
【问题描述】:
我的字符串包含来自不同语言的字符,例如:
en <chars in english> fr <chars in french> es <chars in spanish>
我只需要从上面的字符串中提取特定语言的子字符串。我如何使用 regex 或 python2.6 中的其他工具来做到这一点?
ps。它可能是不同的顺序,例如:en (.) es (.) it (.*),问题是 es 或 fr 或 it - 不是拉丁字符集, - 这就是为什么常规正则表达式无法正常使用它
【问题讨论】:
-
如何在正则表达式中定义
in specific language? -
你有像
[english word(s)] - [spanish word(s)] - ...这样的可靠结构还是你必须猜测语言?这将是一项艰巨的任务。 -
你能发布一个预期结果的例子吗?这不是很清楚......
-
结构如上,新语言字符开始于:english
français español -
这种正则表达式怎么样:
r"english (.*) français (.*) español (.*)"?