【问题标题】:separate texts from a href in same td with XPath python使用 XPath python 在同一 td 中将文本与 href 分开
【发布时间】:2018-10-24 14:31:39
【问题描述】:

我有一个这样的 HTML 网页:

<tr><td style="text-align:center;">7</td><td class="multi_row" style="line-height:15px;">Loaded on 'NYK LEO 303W' at Port of Loading<br> <a href="JavaScript:void(0);" style="line-height:15px;" title="NYK LEO" data-click="vesselPop" data-cd="NLZT0303W">NYK LEO 303W</a></td><td class="multi_row" style="line-height:15px;">VANCOUVER, BC ,CANADA<br>  <a href="JavaScript:void(0);" style="line-height:15px;" onclick="openLocationPopup('CAVAN01')" title="3891 DELTAPORT GCT">3891 DELTAPORT GCT</a></td><td class="ico_e">2018-10-26 23:30</td></tr>

我想将&lt;a href&gt; 的字符串部分分隔到一个变量中,并在另一个变量中包含纯文本,例如“bla bla bla”。 这是我到目前为止所做的:

event_path = driver.find_elements_by_xpath("//table[@id='detail']//tr/td[2]")
event = [cell.text for cell in event_path]

它的文本部分 这个是用于字符串的:

vessel_path = driver.find_elements_by_xpath("//table[@id='detail']//tr/td[2]/a")
vessel = [cell.text.split(' ')[:2] for cell in vessel_path]

split(' ')[:2] 是因为数据是这样的:NYK LEO 303W,我只需要单词而不是数字(使用正则表达式可以做得更可靠)

【问题讨论】:

    标签: python-3.x selenium xpath web-crawler


    【解决方案1】:

    尝试使用下面的方法仅从td获取第一个文本节点

    event = [driver.execute_script('return arguments[0].firstChild.textContent;', cell).strip() for cell in event_path]
    

    【讨论】:

    • 你可以编辑它吗?它不在功能和单元格下)?它会出错。
    • 它返回此错误:selenium.common.exceptions.WebDriverException:消息:服务 /usr/bin/safaridriver 意外退出。状态码是:1
    • 不,这是一个错误,我重新启动了它修复的机器。它分离了文本,但我怎样才能在 中获取文本
    • @iman_sh77,你的意思是vessel = [link.get_attribute('href') for link in vessel_path]
    • 尝试vessel = [cell.text.rsplit(" ", 1)[0] for cell in vessel_path] 忽略最后一个子字符串
    【解决方案2】:

    请尝试以下代码:

    elements = driver.find_elements_by_classname("multi_row")
    
    for element in elements
        print(element.text)
    

    【讨论】:

    • 无法通过 class_name 获取它,因为还有另一个表具有 multi_row 类名和其他内容:输出不与 one 分开
    • 将 driver.find_elements_by_classname("multi_row") 更改为 driver.find_elements_by_classname("//table[@id='detail']//tr/td[2]")
    • 它包含我不想要的 NYK LEO 303W 部件无关紧要
    【解决方案3】:

    在您的情况下,我看到您期望的船只已经存在于锚的标题属性中。

    如果是有效案例,则可以直接从属性中获取,例如,

    vessel_path = driver.find_elements_by_xpath("//table[@id='detail']//tr/td[2]/a")
    vessel = [cell.get_attribute("title") for cell in vessel_path]
    

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 2018-07-30
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 2019-04-13
      • 2017-08-05
      相关资源
      最近更新 更多