【发布时间】:2014-07-06 12:31:02
【问题描述】:
import urllib
data = urllib.urlopen("https://www.python.org/")
for line in data:
line.strip()
print line
我正在尝试制作一个网络爬虫,但是当我运行上面的代码时,一些 HTML 内容也会被打印出来。我只想要网页的文本部分和超链接
【问题讨论】:
import urllib
data = urllib.urlopen("https://www.python.org/")
for line in data:
line.strip()
print line
我正在尝试制作一个网络爬虫,但是当我运行上面的代码时,一些 HTML 内容也会被打印出来。我只想要网页的文本部分和超链接
【问题讨论】:
使用漂亮的汤库来制作网络爬虫和处理 HTML 标签。
【讨论】:
一个基本的解决方案是 .split 在“”标签上,然后检查结果列表以删除从任何“”结束的元素。
【讨论】: