【发布时间】:2016-01-28 15:00:49
【问题描述】:
我想最好使用 java 来实现它,或者如果有办法使用 selenium webdriver 来实现它,我不希望页面中出现链接。我想要像https://www.xml-sitemaps.com/ 这样的结果给出域中所有页面 URL 的列表。我不像树或 xml 那样需要它,只需简单的 URL 即可
【问题讨论】:
-
您要查找的内容通常被称为网络爬虫或网络蜘蛛。尝试谷歌搜索。
-
我用谷歌搜索了它,每个人都说的大部分是获取页面的链接并遍历这些链接并使用 jsoup 在这些页面中找到更多链接,或者我可以使用 selenium webdriver 类似地做到这一点,但是我不想要那个。这有点乏味,并没有解决我的目的,我的主页可以说可能指向许多网站的五十个链接,但我的网站只有 4 个页面,我的主页没有指向所有这四个页面的链接,然后只是为了获取页面这是很多开销。
-
您尝试了哪些方法,结果如何?就像你在学校做的那样……请展示你的作品。 :) 这是在 SO 上回答问题的过程的一部分。它对您很有帮助,因为它迫使您调查自己的问题并仔细考虑。它还向读者证明你做了功课,并做出了合理的尝试来回答你自己的问题。第三,它可以帮助读者发现和诊断问题,从而为您提供更好的答案,减少我们浪费的时间。
标签: java selenium-webdriver web-crawler