【发布时间】:2018-08-10 05:27:39
【问题描述】:
我正在尝试使用 python/lxml 和 xpath() 命令提取图像 URl,但无法隔离 url 本身。
这是我想要的 img src 周围的 HTML:
<div data-index="0" data-za-action="Photo Lightbox - Open" data-za-
category="Homes" class="img-wrapper za-track-event zsg-lightbox-show"
data-target-id="hdp-photo-lightbox" data-za-label="position: 0, total:
18, id: 10660534745" id="yui_3_18_1_2_1519884476676_1986"><img
src="https://photos.zillowstatic.com/p_h/IS2fordnekys6d1000000000.jpg"
onload="if (typeof ClientProfiler !== 'undefined') {
ClientProfiler.profile('HDPFirstPhotoLoaded') }" id="X1-
IAgz3dcnekys6d1000000000_ptw8e" class="hip-photo"></div>
具体来说,我想隔离https://photos.zillowstatic.com/p_h/IS2fordnekys6d1000000000.jpg url。
我尝试了几种方法都没有成功,包括以下变体:
xpath(".//img[@class='hip-photo']/@src")
xpath(".//img[@class='hip-photo']//text()")
【问题讨论】:
-
欢迎来到 SO!请拿起tour,阅读How to Ask和minimal reproducible example!此外,屏幕截图会像磁铁一样吸引反对票。
-
请将代码作为文本包含在
code部分中,而不是作为图像。 -
您确定该页面的内容不是动态生成的吗?如果你是那么没关系,否则你应该使用任何浏览器模拟器来读取元素,然后应用建议的 xpath,甚至你定义的方式也应该这样做。
标签: python html xpath web-scraping lxml