【发布时间】:2015-11-26 11:23:59
【问题描述】:
我是这个论坛的新手(这是我的第一个问题),所以请多多包涵。我正在用瑞典语抓取一个网站。它使用 ISO-8859-1 字符集。
在源代码中它可能看起来像这样:
<div class="fl icon-post-old"></div>
2015-11-13, 15:09
<a href="
假设我想获取日期和时间(这不是一个真实的例子)。
threadcode=opener.open(threadurl).read()
threadcode2=threadcode.decode("ISO-8859-1")
post=re.findall(r'<div class="fl icon-post-old"></div>(.*?)<a',str(threadcode2))
post2=re.findall(r'<div class="fl icon-post-old"></div>(.*?)<a',str(threadcode))
print (post) #this is blank
print (post2) #this works fine
所以,如果我在“可读性好的瑞典变量帖子”中搜索某些内容,它似乎不起作用。但是,如果我使用 Unicode 表示进行相同的搜索(这不是很有用),那么相同的搜索就可以工作。
你们当中有谁知道这里发生了什么的优秀程序员吗?
如果在某些情况下搜索确实有效,我还可以添加... 例如:
post=re.findall(r'Jag vill(.*?)bil',str(threadcode2))
这会起作用...
我很困惑。
【问题讨论】:
-
您的字符串必须是 unicode 字符串,这是一个很好的起点:stackoverflow.com/questions/1327731/…