【发布时间】:2014-01-07 17:25:11
【问题描述】:
所以我正在执行一个 omegle 抓取尝试在线抓取用户。
这是 HTML 代码:
<div id="onlinecount">
<strong>
30,000+
</strong>
</div>
现在我假设使用 LXML 将使用//div[@id="onlinecount"] 来抓取 中的任何文本,我想从标签中获取数字,但是当我尝试抓取时,我最终得到一个空列表
这是我的相关代码:
print "\n Grabbing users online now from",self.website
site = requests.get(self.website)
tree = html.fromstring(site.text)
users = tree.xpath('//div[@id="onlinecount"]')
请注意 self.website 变量只是 http://www.omegle.com
任何想法我做错了什么?请注意,我可以抓取其他部分,但不能抓取在线用户数。
我最终使用了从朋友那里学到的一组不同的代码。 这是我的完整代码,供任何感兴趣的人使用。 http://pastebin.com/u1kTLZtJ
【问题讨论】:
-
我无法从我所在的位置获取源代码,但可能 HTML 代码不是完美的 XML。在这种情况下,lxml 可能无法正确解析树。在这种情况下,BeautifulSoup 来拯救。只是我的两分钱:)