【发布时间】:2016-03-11 10:28:43
【问题描述】:
我写了一个 script 来解析 html 并仅打印文本内容。我想忽略标签。但是我的程序有问题。我不确定它是什么。请帮帮我。
import urllib.request
import re
from bs4 import BeautifulSoup
url = "www.example.com"
def hi():
dep = urllib.request.urlopen(url)
soup = BeautifulSoup(dep, 'html.parser')
for link in soup.find_all('p', string=True):
result = re.sub(b'<.*?>', "", link)
print (result)
hi()
网站link。
【问题讨论】:
-
在此处添加代码。
-
并确保包含完整的回溯作为文本以及您尝试解决问题的内容。
-
@Vasanth 发布代码而不是您尝试抓取的网址..
-
我在这里添加了我的代码。提前致谢。
-
将您的屏幕截图转换为有效代码和有效回溯。你在编辑之前发布了非常混乱的东西。
标签: python beautifulsoup html-parsing