【发布时间】:2021-05-02 15:49:57
【问题描述】:
我正在使用 Python/Selenium 从网站中提取一些文本,以便在 Google 表格中进一步对其进行排序。
我需要为 15 个标题提取文本。该文本位于标签 h5 中的每个标题下。
这是一个标题的摘录:
<tr class="dayHeader">
<td colspan="7" style="padding:10px 0;">
<hr>
<h5> Tuesday - 02 February 2021</h5>
</td>
</tr>
我所做的如下:
headers = driver.find_elements_by_tag_name('h5')
results = []
for header in headers:
result = header.text
results.append(result)
我更喜欢通过这个标签上方的类从 h5 中获取文本,如下所示:
headers = driver.find_element(By.XPATH,"//tr[@class='dayHeader']/h5")
并将其添加到提到的 for 循环中,但我似乎无法让这条线工作。我该怎么做?
【问题讨论】:
-
如果您只希望
tr元素中的h5元素具有dayHeader类,那么您可以使用//tr[@class='dayHeader']/descendant::h5。 -
您面临的问题是什么?
标签: python for-loop selenium-webdriver web-scraping xpath