【发布时间】:2019-04-13 03:59:02
【问题描述】:
我正在尝试为电影网站制作一个刮板,以收集电影名称列表。
我尝试使用 BeautifulSoup 来解析 HTML 文件,我看到每部电影都在一个名为 "movie-row" 的类中。但是在这个类上使用select 方法并没有检索到站点的相应数据。我能得到的最接近的 HTML 组件是 .quickbook-section 的父类。
为什么有些 HTML 标签在 BS 中可用,而有些则不可用?
这是我编写的代码。
def get_movies_names():
url = "https://www.yesplanet.co.il/#/buy-tickets-by-cinema?in-cinema=1025&at=2018-11-09&view-mode=list"
raw_html = util.simple_get(url)
bs = BeautifulSoup(raw_html, 'html.parser')
bs.select(".movie-row")
(simple_get只是一个返回HTML响应内容的函数)
【问题讨论】:
-
BS 无法处理 JavaScript,您可能会遇到这个问题,其中某些网站是通过 JavaScript 加载的
标签: python web-scraping beautifulsoup