【发布时间】:2017-02-17 11:02:38
【问题描述】:
我正在尝试抓取该站点并获取两个单独的标签。这就是 html 的样子。
<url>
<loc>
http://link.com
</loc>
<lastmod>date</lastmode>
<changefreq>daily</changefreq>
<image:image>
<image:loc>
https://imagelink.com
<image:loc>
<image:title>Item title</image:title>
<image:image>
</url>
我想要获取的标签是 loc 和 image:title。我遇到的问题是标题标签中的冒号。我到目前为止的代码是
r = requests.get(url)
soup = BeautifulSoup(r.content, 'html.parser')
for item in soup.find_all('url'):
print(item.loc)
#print image title
我也尝试过这样做
print(item.title)
但这不起作用
【问题讨论】:
-
那是 xml 而不是 html 和一个附加了命名空间的节点而不是两个。你从哪里弄来的?
标签: python python-3.x tags beautifulsoup bs4