【发布时间】:2011-12-06 20:13:38
【问题描述】:
我正在尝试使用 Python 2.7.2 中的正则表达式从字符串中提取所有出现的标记词。或者简单地说,我想提取[p][/p] 标签内的每一段文本。
这是我的尝试:
regex = ur"[\u005B1P\u005D.+?\u005B\u002FP\u005D]+?"
line = "President [P] Barack Obama [/P] met Microsoft founder [P] Bill Gates [/P], yesterday."
person = re.findall(pattern, line)
打印person 产生['President [P]', '[/P]', '[P] Bill Gates [/P]']
正确的正则表达式是什么:['[P] Barack Obama [/P]', '[P] Bill Gates [/p]']
或['Barrack Obama', 'Bill Gates']。
【问题讨论】: