【发布时间】:2012-09-12 20:45:53
【问题描述】:
我有这个小代码,它给了我 AttributeError: 'NoneType' object has no attribute 'group'。
import sys
import re
#def extract_names(filename):
f = open('name.html', 'r')
text = f.read()
match = re.search (r'<hgroup><h1>(\w+)</h1>', text)
second = re.search (r'<li class="hover">Employees: <b>(\d+,\d+)</b></li>', text)
outf = open('details.txt', 'a')
outf.write(match)
outf.close()
我的意图是读取一个 .HTML 文件,查找 <h1> 标记值和员工数量,并将它们附加到文件中。但由于某种原因,我似乎无法正确处理。
非常感谢您的帮助。
【问题讨论】:
-
我认为像 Scrapy of Beautiful Soap 这样的高级库比正则表达式更适合您的任务。
-
@larsmans:无数其他人还包括this one,它实际上演示了如何使用正则表达式解析 HTML。与此相比,海伦在这里的任务微不足道。所以不太高兴。
-
很遗憾你不能使用
vi来编辑HTML文件,innit? -
如果您显示您正在查看的 HTML 文件的相关部分,将会有很大帮助。