【发布时间】:2018-01-12 04:38:26
【问题描述】:
我正在尝试打印结果页面的链接列表,然后在其自身上调用scraper 函数,同时将变量pageNum 加1。出于某种原因,此代码仅打印出每页上的第一个结果,而不是打印所有结果然后转到下一页。如何在递归调用scraper 函数之前等待我的打印函数完全完成
from urllib.request import Request, urlopen
from bs4 import BeautifulSoup
import re
def scraper(pageNum):
req = Request("http://www.someurl.com/Search/page="+str(pageNum)+"&facet_Category=20", headers={"User-Agent": "Mozilla/5.0"})
html = urlopen(req).read()
bsObj = BeautifulSoup(html)
for result in bsObj.select("h2 a"):
print(result["href"])
scraper(pageNum+1)
scraper(1)
【问题讨论】:
标签: python beautifulsoup screen-scraping