【发布时间】:2019-06-15 22:56:50
【问题描述】:
我有一个这样的字符串
html = "<pre>City_<cityname>_001</pre>"
在尝试使用 BeautifulSoup 4 解析这个时,使用以下代码,
>>> from bs4 import BeautifulSoup
>>> html = "<pre>City_<cityname>_001</pre>"
>>> soup = BeautifulSoup(html, "html.parser")
>>> soup
<pre>City_<cityname>_001</cityname></pre>
>>> soup.text
City__001
可以看出,BeautifulSoup 将cityname 视为一个新标签。
有没有什么方法可以避免这种情况以获得正确的文本和 html?
【问题讨论】:
-
那么你希望这个例子的输出是什么?
-
想要的输出是
City_<cityname>_001。
标签: python python-3.x beautifulsoup html-parsing