【发布时间】:2011-03-10 16:19:14
【问题描述】:
我使用Text::Ngrams 来确定字符串中的单词组合。但是,我需要保留其中包含数字的单词。我已经确定 $o->{tokenrex} 是我需要修改的,但我无法确定它的正确正则表达式。
原件是qr/([a-zA-Z]+|(\d+(\.\d+)?|\d*\.\d+)([eE][-+]?\d+)?)/;,但我想我需要更多类似的东西:
qr/([a-zA-Z]+|(?<=\w)(\d+(\.\d+)?|\d*\.\d+)([eE][-+]?\d+)?(?=\w)|(\d+(\.\d+)?|\d*\.\d+)([eE][-+]?\d+)?)/;
如果我正确阅读正则表达式,应该匹配任意数量的字母字符,或前后有单词字符的“数字”,或“数字”。除了它将我的“单词”分成单独的标记之外。我正在使用的示例词是“A1X”。
任何帮助都会很棒。
【问题讨论】:
-
学习使用并喜欢
x正则表达式修饰符,它允许您在正则表达式中使用空格(空格、制表符、换行符)进行格式化 -
@Eric Strom 我完全计划这样做;在我尝试解释它的作用之前,我宁愿让它工作:)
-
这就是重点。如果你能看到它的作用,它就会更容易工作!