【发布时间】:2015-03-12 15:04:54
【问题描述】:
我在 python 3 中使用正则表达式时遇到问题,所以如果有人可以帮助我,我会很高兴。我有一个像下面这样的文本文件:
Header A
text text
text text
Header B
text text
text text
Header C
text text
here is the end
我想做的是在标题之间列出一个文本列表,但包括标题本身。 我正在使用这个正则表达式:
re.findall(r'(?=(Header.*?Header|Header.*?end))',data, re.DOTALL)
结果在这里
['Header A\ntext text\n text text\n Header', 'Header B\ntext text\n text text\n Header', 'Header C\n text text here is the end']
问题是我在列表中每个项目的末尾得到下一个标题。如您所见,当我们找到下一个标头时,每个标头都会结束,但最后一个标头不会以特定方式结束
有没有办法使用正则表达式获取每个标题的列表(不是元组),包括它自己的文本作为子字符串?
【问题讨论】: