【发布时间】:2021-01-10 02:34:20
【问题描述】:
我正在使用 python 3.7 和 BeautifulSoup 来抓取 Wordpress 提要。我无法从链接标签中抓取数据。所有其他标签都有效。如果我重命名标签,它会起作用。这是一个剥离的 xml 示例 -
<?xml version="1.0" encoding="UTF-8"?>
<rss version="2.0">
<channel>
<site xmlns="com-wordpress:feed-additions:1">12345</site>
<item>
<title>My title</title>
<link>https://test.com/test/</link>
<linktest>https://test.com/test/</linktest>
</item>
</channel>
</rss>
如果我这样解析 -
soup = BeautifulSoup(open('./sources/falskanyheter.xml', 'r'), 'lxml')
print(soup.prettify())
我得到了结果-
<?xml version="1.0" encoding="UTF-8"?>
<html>
<body>
<rss version="2.0">
<channel>
<site xmlns="com-wordpress:feed-additions:1">
12345
</site>
<item>
<title>
My title
</title>
<link/>
https://test.com/test/
<linktest>
https://test.com/test/
</linktest>
</item>
</channel>
</rss>
</body>
</html>
链接/url不在链接标签中,无法解析,例如-tag.link.text
【问题讨论】:
标签: python beautifulsoup