【发布时间】:2021-02-05 17:32:34
【问题描述】:
如上所述,我试图从打印输出中删除 HTML 以获取文本和我的分割 |和 -。我得到了跨度信息以及我想删除的其他信息。由于它是循环程序的一部分,因此我无法在页面更改时搜索页面的各个文本信息。页面架构保持不变,这就是打印列表中的项目保持不变的原因。想知道清理输出的最简单方法是什么。这是代码部分:
infoLink = driver.find_element_by_xpath("//a[contains(@href, '?tmpl=component&detail=true&parcel=')]").click()
driver.switch_to.window(driver.window_handles[1])
aInfo = driver.current_url
data = requests.get(aInfo)
src = data.text
soup = BeautifulSoup(src, "html.parser")
parsed = soup.find_all("td")
for item in parsed:
Original = (parsed[21])
Owner = parsed[13]
Address = parsed[17]
print (*Original, "|",*Owner, "-",*Address)
示例输出为:
<span class="detail-text">123 Main St</span> | <span class="detail-text">Banner,Bruce</span> - <span class="detail-text">1313 Mockingbird Lane<br>Santa Monica, CA 90405</br></span>
谢谢!
【问题讨论】:
标签: python html beautifulsoup