【发布时间】:2015-06-10 04:09:14
【问题描述】:
我正在尝试从一个使用 python 和 selenium 构建的网站中提取数据:
<table>
<tbody>
<tr>
<td> text </td>
<td>
<td> text </td>
</td>
<td>
<td> text </td>
</td>
<tr>
<td> text </td>
<td>
<td> text </td>
</td>
<td>
<td> text </td>
</td>
这是我使用 selenium 提取数据的代码:
data=[]
for tr in driver.find_elements_by_xpath('//table[@id="pinnedtablepositionsTable"]//tr'):
tds =tr.find_elements_by_tag_name('td')
if tds:
data.append([td.text for td in tds])
打印(数据)
当我打印数据时,我只是网站中每一行的第一列。网站上的表格的结构是行相互嵌套的。有没有人处理过以这种格式构建的网站。我对除了 selenium 之外的其他爬虫持开放态度,我只是喜欢将它用于自动化目的。
【问题讨论】:
标签: python selenium web-scraping data-extraction