【发布时间】:2020-01-16 07:49:39
【问题描述】:
我知道这不是错误,但我不明白如何抓取印度初创公司网站,我正在尝试点击印度初创公司提供的一些网站,但我无法点击它们,因为 scrapy 无法点击网站而我所掌握的任何信息都只能通过点击该链接来获取。
import scrapy
from selenium import webdriver
import os
class ProductSpider(scrapy.Spider):
name = "product_spider"
allowed_domains = ['https://www.startupindia.gov.in/']
start_urls = ['https://www.startupindia.gov.in/content/sih/en/search.html?industries=sih:industry/advertising&states=sih:location/india/andhra-pradesh&stages=Prototype&roles=Startup&page=0']
def __init__(self):
cwd = os.getcwd()
self.driver = webdriver.Chrome("C:/Users/RAJ/PycharmProjects/WebCrawler/WebCrawler/WebCrawler/spiders/chromedriver.exe")
self.profile = []
def parse(self, response):
self.driver.get(response.url)
while True:
next = self.driver.find_element_by_xpath('//*[@id="persona-results"]/div[1]/div/a/div[1]')
try:
next.click()
# get the data and write it to scrapy items
except:
break
self.driver.close()
顺便说一句,我的最终目标是获取所有个人资料详细信息,但我不知道怎么做 (PS:这是我第一次做网页抓取)
【问题讨论】:
-
如果只向我显示代码,我想点击网站会很棒。
-
您不能通过 Scrapy 本身单击,而是可以通过某种方式获取 HREF。将链接和您的尝试放在您的问题中。
-
不过我正在使用硒蜘蛛。
标签: python-3.x web-scraping scrapy