【发布时间】:2019-11-05 06:29:38
【问题描述】:
我正在尝试抓取this webpage。
我希望从“照片流容器”中下载一些照片,但没有成功。以下是我目前正在使用的代码块。
查找所有以“自适应”开头的跨度类 作为示例类将是“AdaptiveStreamGridImage grid-tweet has-cards has-content enabled clear first-row hoverZoomLink”
有什么建议吗?
d = requests.get('https://twitter.com/search?f=images&vertical=news&q=Iran').text
soup = BeautifulSoup(d, 'html.parser')
spans = soup.findAll("span", {"class": lambda x: x and x.startswith('Adaptive')})
print(spans)
打印“跨度”时收到一个空列表
[]
【问题讨论】:
-
您是否检查了页面源中是否存在您要查找的元素?
-
我正在寻找包含单词“Adaptive”的跨度类 - 这是在检查页面时发现的
-
我推荐使用
soup.select('span[class^=Adaptive]'),使用css选择器更酷 -
你知道禁止网络抓取的 Twitter 服务条款,我希望? (“使用服务”twitter.com/en/tos 下的第 4 节) - 这可能会导致您的 IP 地址被禁止。为什么不使用 API?
标签: python html web-scraping twitter beautifulsoup