【发布时间】:2021-02-07 22:41:20
【问题描述】:
我正在使用 Python 和 Beautiful Soup 和 requests 模块构建一个网页抓取项目,问题是我要抓取的网站在将我重定向到主页之前有一个加载页面(与主页完全不同) .我怎样才能等到页面加载完成然后从主页上抓取数据。我知道 Selenium 可以处理这些类型的网站,但该网站必须使用我的项目中不需要的网络驱动程序启动,这就是我使用 Beautiful Soup 和请求模块的原因。到目前为止,这是我的代码。
from bs4 import BeautifulSoup
import requests
import time
source = requests.get(url).text
print(source)
我刚刚开始我的项目,所以这就是我到目前为止编写的所有代码。我愿意为此更改模块。
【问题讨论】:
-
介意分享那个网站的网址吗?
-
这是一个免费阅读漫画(日本漫画)的网站,这里是link。如果您是第一次打开网站,它会显示加载页面。
-
我想,我找到了解决方案。我可以使用不打开浏览器但仍可以抓取数据的 selenium headless。我会试试看它是否有效并提供更新
标签: python python-3.x web-scraping