【发布时间】:2018-10-24 14:31:39
【问题描述】:
我有一个这样的 HTML 网页:
<tr><td style="text-align:center;">7</td><td class="multi_row" style="line-height:15px;">Loaded on 'NYK LEO 303W' at Port of Loading<br> <a href="JavaScript:void(0);" style="line-height:15px;" title="NYK LEO" data-click="vesselPop" data-cd="NLZT0303W">NYK LEO 303W</a></td><td class="multi_row" style="line-height:15px;">VANCOUVER, BC ,CANADA<br> <a href="JavaScript:void(0);" style="line-height:15px;" onclick="openLocationPopup('CAVAN01')" title="3891 DELTAPORT GCT">3891 DELTAPORT GCT</a></td><td class="ico_e">2018-10-26 23:30</td></tr>
我想将<a href> 的字符串部分分隔到一个变量中,并在另一个变量中包含纯文本,例如“bla bla bla”。
这是我到目前为止所做的:
event_path = driver.find_elements_by_xpath("//table[@id='detail']//tr/td[2]")
event = [cell.text for cell in event_path]
它的文本部分 这个是用于字符串的:
vessel_path = driver.find_elements_by_xpath("//table[@id='detail']//tr/td[2]/a")
vessel = [cell.text.split(' ')[:2] for cell in vessel_path]
split(' ')[:2] 是因为数据是这样的:NYK LEO 303W,我只需要单词而不是数字(使用正则表达式可以做得更可靠)
【问题讨论】:
标签: python-3.x selenium xpath web-crawler