【问题标题】:How can I programatically get URL of all pages in a website如何以编程方式获取网站中所有页面的 URL
【发布时间】:2016-01-28 15:00:49
【问题描述】:

我想最好使用 java 来实现它,或者如果有办法使用 selenium webdriver 来实现它,我不希望页面中出现链接。我想要像https://www.xml-sitemaps.com/ 这样的结果给出域中所有页面 URL 的列表。我不像树或 xml 那样需要它,只需简单的 URL 即可

【问题讨论】:

  • 您要查找的内容通常被称为网络爬虫或网络蜘蛛。尝试谷歌搜索。
  • 我用谷歌搜索了它,每个人都说的大部分是获取页面的链接并遍历这些链接并使用 jsoup 在这些页面中找到更多链接,或者我可以使用 selenium webdriver 类似地做到这一点,但是我不想要那个。这有点乏味,并没有解决我的目的,我的主页可以说可能指向许多网站的五十个链接,但我的网站只有 4 个页面,我的主页没有指向所有这四个页面的链接,然后只是为了获取页面这是很多开销。
  • 您尝试了哪些方法,结果如何?就像你在学校做的那样……请展示你的作品。 :) 这是在 SO 上回答问题的过程的一部分。它对您很有帮助,因为它迫使您调查自己的问题并仔细考虑。它还向读者证明你做了功课,并做出了合理的尝试来回答你自己的问题。第三,它可以帮助读者发现和诊断问题,从而为您提供更好的答案,减少我们浪费的时间。

标签: java selenium-webdriver web-crawler


【解决方案1】:

您可以查找标签(如 href 或 a ),然后将链接存储在列表中。

列出链接 = driver.findElements(By.tagName("href"));

【讨论】:

    猜你喜欢
    • 2011-02-23
    • 2011-06-16
    • 1970-01-01
    • 1970-01-01
    • 2016-07-26
    • 1970-01-01
    • 2012-05-14
    • 2019-05-15
    • 1970-01-01
    相关资源
    最近更新 更多