【发布时间】:2017-06-01 10:20:33
【问题描述】:
我正在抓取一个新闻网站以提取所有链接,包括新闻网站典型的存档链接。网站here 有一个按钮View More Stories,用于加载更多网站文章。现在下面这段代码
def find_urls():
start_url = "e.vnexpress.net/news/business"
r = requests.get("http://" + start_url)
data = r.text
soup = BeautifulSoup(data, "html.parser")
links = soup.findAll('a')
url_list = []
for url in links:
all_link = url.get('href')
if all_link.startswith('http://e.vnexpress.net/news/business'):
url_list.append(all_link)
return set(url_list)
成功加载了相当多的url,但是我如何在这里加载更多的是按钮的sn-p
<a href="javascript:void(0)" id="vnexpress_folder_load_more" data-page="2"
data-cate="1003895">
View more stories
</a>
谁能帮帮我。谢谢。
【问题讨论】:
-
加载更多来自
post请求的故事。因此,首先构建下一页 url,然后执行post请求,这是您的下一页 url e.vnexpress.net/news/business?cate_id=1003895&page=2 。你需要传递2个参数cate_id和page -
@akashkarothiya 你能给我更多解释吗?问候!
标签: python beautifulsoup web-crawler