【发布时间】:2021-05-07 15:45:36
【问题描述】:
我正在尝试从这个webpage 中抓取title、website 和email。那里提供的内容非常动态。尽管requests 模块无法处理 javascript 繁重的内容,但总是有替代方法可以使用库获取相同的内容,就像使用从开发工具检索到的任何外部链接一样。但是,我就是找不到正确的方法。
我试过了:
import requests
from bs4 import BeautifulSoup
link = 'https://www.firmy.cz/detail/13153157-azajola-stare-mesto-nova-seninka.html'
with requests.Session() as s:
s.headers['User-Agent'] = 'Mozilla/5.0 (Windows NT 6.1) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/88.0.4324.150 Safari/537.36'
res = s.get(link)
soup = BeautifulSoup(res.text,"lxml")
title = soup.select_one("h1").text
website = soup.select_one("a.companyUrl").text
email = soup.select_one("a.companyMail").text
print(title,website,email)
当我运行上面的脚本时,它会抛出AttributeError。
我追求的输出:
AZAJOLA, s.r.o., www.chatanovaseninka.cz, info@chatanovaseninka.cz
PS 我不想使用 selenium 之类的浏览器模拟器。
【问题讨论】:
标签: python python-3.x web-scraping python-requests