【问题标题】:Trying to Extract all the Artists name using BeautifulSoup尝试使用 BeautifulSoup 提取所有艺术家的名字
【发布时间】:2017-11-02 02:33:34
【问题描述】:

我最近开始使用 BeautifulSoup 进行网页抓取。我正在尝试从arts website国家画廊的第一页提取所有艺术家的名字。

这是我的代码

import requests

from bs4 import BeautifulSoup

data=requests.get('https://www.nga.gov/Collection/artists.html?pageNumber=1')

soup=BeautifulSoup(data.content,'html.parser')

soup.find_all('a')

当我这样做时,我会得到页面中的所有链接,但包含艺术家姓名的链接除外。

例如,对于艺术家“Greek A” Factory,这是在 Chrome 中使用检查选项后找到的标签 '"Greek A" Factory' 但这在我创建的汤对象中的任何地方都找不到。 你能告诉我我在这里犯了什么错误吗?

【问题讨论】:

  • ul class returns 中具有超链接引用文本希腊工厂的数据具有动态内容。这是一个相关的question

标签: python html web-scraping beautifulsoup python-requests


【解决方案1】:

试试这个:

from selenium import webdriver
from bs4 import BeautifulSoup
import time

driver = webdriver.Chrome()
driver.get('https://www.nga.gov/Collection/artists.html?pageNumber=1')
time.sleep(5)
soup = BeautifulSoup(driver.page_source,'lxml')
driver.quit()

for artist_name in soup.select('.title a'):
    print(artist_name.text)

部分结果:

"Greek A" Factory
2 Bit Comics
7 Freds Press
A. B.
Aachen, Hans von
Aarland, Johann Carl Wilhelm
Abakanowicz, Magdalena

【讨论】:

    猜你喜欢
    • 2022-08-03
    • 1970-01-01
    • 2021-05-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2012-11-21
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多