【问题标题】:Web scraping with python and selenium使用 python 和 selenium 进行网页抓取
【发布时间】:2015-06-10 04:09:14
【问题描述】:

我正在尝试从一个使用 python 和 selenium 构建的网站中提取数据:

  <table> 
     <tbody>
         <tr> 
            <td> text </td>
            <td>
               <td> text </td>
            </td> 
            <td> 
               <td> text </td>
            </td>
          <tr>  
            <td> text </td>
            <td>
               <td> text </td>
            </td> 
            <td> 
               <td> text </td>
            </td>

这是我使用 selenium 提取数据的代码:

data=[]
        for tr in driver.find_elements_by_xpath('//table[@id="pinnedtablepositionsTable"]//tr'):
            tds =tr.find_elements_by_tag_name('td')
        if tds: 
                 data.append([td.text for td in tds])

打印(数据)

当我打印数据时,我只是网站中每一行的第一列。网站上的表格的结构是行相互嵌套的。有没有人处理过以这种格式构建的网站。我对除了 selenium 之外的其他爬虫持开放态度,我只是喜欢将它用于自动化目的。

【问题讨论】:

    标签: python selenium web-scraping data-extraction


    【解决方案1】:

    我认为你的程序的缩进是错误的,应该是-

    data=[]
    for tr in driver.find_elements_by_xpath('//table[@id="pinnedtablepositionsTable"]//tr'):
        tds =tr.find_elements_by_tag_name('td')
        if tds: 
            data.append([td.text for td in tds])
    

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 2021-05-08
      • 2018-07-20
      • 2020-03-13
      • 1970-01-01
      • 2023-04-02
      相关资源
      最近更新 更多