【发布时间】:2014-11-15 20:33:23
【问题描述】:
当我处理一些 html 时,我想要图像的 src url,但我得到的是编码图像。如果我想要网址,我做错了什么?
给定一个网址,例如:“http://www.amazon.com/Cheese-Plate-multi-purpose-mounting-plate/dp/B00CI06DWE/”
还有一个桌面用户代理:
from lxml import etree
import requests
page = requests.get(url, headers=agent)
page_txt = page.text
html_parser = etree.HTMLParser()
tree = etree.parse(StringIO(page_txt), html_parser)
path = '//img[@id="landingImage"]'
img = tree.xpath(path)
img_src = img[0].get('src')
使用该代码,我回来了:
'\ndata:image/jpeg;base64,/9j/4AAQSkZJR'(截断)
当我想要时:
【问题讨论】:
标签: python python-2.7 xpath html-parsing lxml