【发布时间】:2018-07-08 14:35:17
【问题描述】:
大家晚上好,
我目前正在尝试抓取 zalando 网站以获取出现在以下网址前两页上的每个产品的名称:(https://www.zalando.nl/damesschoenen-sneakers/)
这是我的代码:
require(rvest)
require(dplyr)
url <- read_html('https://www.zalando.nl/damesschoenen-sneakers/')
selector_name <- '.z-nvg-cognac_brandName-2XZRz'
output <- html_nodes(x = url, css = selector_name) %>% html_text
结果是一个包含 24 个项目的列表,而页面上有 86 个产品。有没有人遇到过这个问题?关于如何解决它的任何想法? 感谢您的帮助。
托马斯
【问题讨论】:
-
看起来页面在您转到时加载了 24 个项目,并且在您滚动时加载更多。
-
首先,通过不同的用户代理访问网页通常会产生不同的布局。其次,正如 Gregor 所说,它看起来很像这是一个基于 java 的布局,它不会通过 rvest 轻松加载。通过将 url 对象写入浏览器并将其加载到浏览器中来检查你得到了什么。 IE。 write_html(url, file = "test_url.html")
-
@Gregor 谢谢你的评论。关于如何绕过这个问题的任何想法?
-
@NicolásVelásquez,我刚刚回复了您的评论。