【发布时间】:2009-01-21 11:30:25
【问题描述】:
我有一个 txt 文件,它实际上是某个网页的 html 源。 在该 txt 文件中,有各种以“title=”标记开头的字符串。 例如
<div id='UWTDivDomains_5_6_2_2' title='Connectivity Framework'>
我有兴趣提取文本 Connectivity Framework 并将其写入单独的文件。
像这样,有很多这样的标签,每个标签在 title='some text here which I need to extract' 之后都有不同的文本 我想从 html 源/txt 文件中提取所有此类文本实例并写入单独的 txt 文件。文本只能包含小写、大写字母和数字。每个文本字符串的长度(以字符为单位)会有所不同。
我正在为 Windows 使用 PowerGrep。 Powergrep 允许我使用正则表达式 inout 搜索文本文件。 我尝试使用搜索作为 标题='[a-zA-Z0-9]
它显示正确的匹配,但它只匹配字符串的第一个字符,并且只写入与第二个 txt 文件匹配的文本字符串的第一个字符,而不是所有字符串。
我希望所有字符串都匹配并写入第二个文件。
什么是正确的正则表达式或使用 powergrep 做我想做的事情的方法?
-AD。
【问题讨论】: