【问题标题】:Python Extracting LinksPython 提取链接
【发布时间】:2018-12-25 19:00:54
【问题描述】:

有没有办法从单个页面中提取所有链接(例如该页面有 3 个链接)。

然后,Python 会打开这 3 个链接,并从这三个链接中提取所有链接(例如,每个链接有 2 个链接)?

有人可以写我用什么提取这样的链接。但是,我想在打开这些链接时对它们做一些事情,例如从该站点中提取所有数字。我想在其中一部分使用 BeautifulSoup,但只能使用 BS4 或 BS4 来完成吗?

【问题讨论】:

  • 您即将被否决或关闭此帖子,因为您要求 SO 社区为您编写代码。请展示您迄今为止尝试过的代码,并说明哪些工作/不工作。
  • 对不起,我不是要求写代码。我想看看我需要学习什么,模块等......
  • @YoungBoi,我已经理解并回答了同样的问题
  • BS4 没有任何代码来下载链接,所以你还需要一些方法来做到这一点——你可以在 stdlib 中使用urllib.request,或者requests,或者你可以写低-级别的套接字代码,但你必须使用 BS4 以外的东西。 (BS4 也需要一个解析器,但为此,只需将一个名称添加到构造函数中,所以我认为这并不真正算作需要使用其他任何东西。)
  • 但是无论如何,如果这个问题不是太宽泛而无法回答,它基本上是一个图书馆推荐或教程推荐的问题。这两个问题都是非常好的问题,但不幸的是 Stack Overflow 不是问这些问题的正确地方。

标签: python hyperlink beautifulsoup


【解决方案1】:

您可以为此使用scrapy。

首先,要从页面获取所有链接,您可以浏览以下 SO 帖子
1.retrieve links from web page using python and BeautifulSoup
2.Fetch all href link using selenium in python

所以,一旦您了解了如何获取链接,请阅读以下教程 https://doc.scrapy.org/en/latest/intro/tutorial.html
您需要的正是 This 。基本上,您将在每个页面上使用 yield 以及在该特定页面中找到的所有链接。

【讨论】:

    猜你喜欢
    • 2020-10-04
    • 1970-01-01
    • 1970-01-01
    • 2012-02-15
    • 2022-09-23
    • 1970-01-01
    • 2011-07-11
    • 2020-10-28
    相关资源
    最近更新 更多