【发布时间】:2014-07-29 20:24:04
【问题描述】:
好的,请保持温和 - 这是我的第一个 stackoverflow 问题,我已经为此苦苦挣扎了几个小时。我确信答案很明显,盯着我的脸,但我放弃了。
我正在尝试从名称网站中抓取网页中的元素(即确定名称的性别)。
我写的python代码在这里:
import re
import urllib2
response=urllib2.urlopen("http://www.behindthename.com/name/janet")
html=response.read()
print html
patterns = ['Masculine','Feminine']
for pattern in patterns:
print "Looking for %s in %s<<<" % (pattern,html)
if re.findall(pattern,html):
print "Found a match!"
exit
else:
print "No match!"
当我转储 html 时,我在那里看到 Feminine,但 re.findall 不匹配。我到底做错了什么?
【问题讨论】:
-
你知道用这么简单的正则表达式你就可以做到
if pattern in html? -
尽管有其他答案,但我看不出您给出的代码实际上不起作用的任何原因。如果你
print re.findall(pattern, html)在循环中,你会得到什么?
标签: python html regex html-parsing expression