【问题标题】:how can i remove the html content from the output?如何从输出中删除 html 内容?
【发布时间】:2014-07-06 12:31:02
【问题描述】:
import urllib

data = urllib.urlopen("https://www.python.org/")
for line in data:
    line.strip()
    print line

我正在尝试制作一个网络爬虫,但是当我运行上面的代码时,一些 HTML 内容也会被打印出来。我只想要网页的文本部分和超链接

【问题讨论】:

    标签: python-2.7 web-crawler


    【解决方案1】:

    使用漂亮的汤库来制作网络爬虫和处理 HTML 标签。

    【讨论】:

      【解决方案2】:

      一个基本的解决方案是 .split 在“”标签上,然后检查结果列表以删除从任何“”结束的元素。

      【讨论】:

        猜你喜欢
        • 2014-06-30
        • 1970-01-01
        • 2011-02-23
        • 1970-01-01
        • 1970-01-01
        • 2022-11-10
        • 2022-11-22
        • 2019-07-09
        • 1970-01-01
        相关资源
        最近更新 更多