【问题标题】:Python Web Scraping: scraping a page with loading pagePython Web Scraping:使用加载页面抓取页面
【发布时间】:2021-02-07 22:41:20
【问题描述】:

我正在使用 Python 和 Beautiful Soup 和 requests 模块构建一个网页抓取项目,问题是我要抓取的网站在将我重定向到主页之前有一个加载页面(与主页完全不同) .我怎样才能等到页面加载完成然后从主页上抓取数据。我知道 Selenium 可以处理这些类型的网站,但该网站必须使用我的项目中不需要的网络驱动程序启动,这就是我使用 Beautiful Soup 和请求模块的原因。到目前为止,这是我的代码。

from bs4 import BeautifulSoup
import requests
import time

source = requests.get(url).text
print(source)

我刚刚开始我的项目,所以这就是我到目前为止编写的所有代码。我愿意为此更改模块。

【问题讨论】:

  • 介意分享那个网站的网址吗?
  • 这是一个免费阅读漫画(日本漫画)的网站,这里是link。如果您是第一次打开网站,它会显示加载页面。
  • 我想,我找到了解决方案。我可以使用不打开浏览器但仍可以抓取数据的 selenium headless。我会试试看它是否有效并提供更新

标签: python python-3.x web-scraping


【解决方案1】:

对于不希望在使用 selenium 时启动浏览器的您,请使用此代码。

from selenium import webdriver

options = webdriver.ChromeOptions()
options.headless = True
driver = webdriver.Chrome(options=options)

driver.get('https://www.google.com/')
print(driver.title)

我已经通过 chrome 驱动程序将我的计算机的环境变量路径放入了。如果你不把你的web驱动放到路径中,把驱动变量改成这个

driver = webdriver.Chrome(executable_path='your web driver path', options=options)

知道 selenium 可以处理加载页面的网站,这应该可以解决我的问题

【讨论】:

    猜你喜欢
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2019-06-08
    • 1970-01-01
    相关资源
    最近更新 更多