【发布时间】:2020-10-25 22:33:28
【问题描述】:
我正在尝试从网站上抓取一张表格,但效果不佳。我正在使用 Python 3.7.4 和 bs4 4.8.2。另外,我不精通 HTML,如果我弄错了一些术语,请见谅。
我正在尝试使用“id = 'track_1_box'”来抓取父类下的表类,可以看到here。我试图提取的信息是字符串“title = 'Canada'”和“Cole”,但现在我什至无法访问该表。
这是我迄今为止所尝试的。
import requests
import numpy as np
from bs4 import BeautifulSoup
from csv import writer
#%%
url = 'https://www.mkleaderboards.com/mkw/charts/world/nonsc/12'
response = requests.get(url)
soup = BeautifulSoup(response.text, 'html.parser')
table = soup.find("table", class_='table')
但是,“table”变量返回一个空列表。我也尝试使用
访问父类soup.find_all(class_ = 'panel inline_box track_box')
返回
[<div class="panel inline_box track_box" id="track_1_box">
</div>, <div class="panel inline_box track_box" id="track_2_box">
</div>, <div class="panel inline_box track_box" id="track_3_box">
</div>, <div class="panel inline_box track_box" id="track_4_box">
</div>]
但不是四个 div 类的“内部”。
是我做错了什么,还是网站有什么东西阻止我刮桌子?
【问题讨论】:
标签: python web-scraping beautifulsoup