【发布时间】:2013-12-05 09:44:23
【问题描述】:
我正在玩python,我想用正则表达式解决以下问题:
我想用正则表达式从网站解析 html。 我以字符串形式获取该站点。我把网站的每一行都放在一个循环中。
for line in html.splitlines():
#print line
matchObj = re.match( r'<h1(.*)>', line, re.M|re.I)
if matchObj:
print matchObj.group()
我想匹配与<h1 class="hidden offscreen" tabindex="0"> anyContent </h1>匹配的每一行
【问题讨论】:
-
您需要什么好的提示?什么对你有用/没用?你看过 re 模块的文档了吗?
-
使用 HTMLParser 模块。如果你看看他们的例子,这并不难。
-
为什么每个人都想用正则表达式解析 html?
-
@InbarRose Obligatory link:选择答案而不是非答案。