【发布时间】:2019-07-20 21:20:15
【问题描述】:
我正在使用漂亮的汤从 rss 页面解析 html 代码。如何保留链接标签?
最有希望的代码是:
python
import urllib.request, urllib.parse, urllib.error
from bs4 import BeautifulSoup
url = 'https://advisories.ncsc.nl/rss/advisories'
uh = urllib.request.urlopen(url)
html_doc= uh.read()
soup = BeautifulSoup(html_doc, 'html.parser')
我试过import lxml 并将代码切换到
python soup = BeautifulSoup(html_doc, 'xml')
但这给了我一个错误:
ModuleNotFoundError: No module named 'lxml'
我希望结果是
<link>https://someurl.org</link>但输出是<link/>someurl.org
【问题讨论】:
-
什么结果?你不用
soup做任何事情。 -
print(soup)的结果,应该加了。
标签: python beautifulsoup xml-parsing