【问题标题】:Extracting information using XPaths使用 XPath 提取信息
【发布时间】:2016-08-17 15:42:37
【问题描述】:

亲爱的社区,下午好,

我终于编制了一份工作 XPath 的列表,需要从我需要的 URL 中抓取所有信息。

我想请教您的建议,对于编码新手来说,仅使用 XPath(每个链接大约 100 个 xpath)抓取大约 50k 链接的最佳方法是什么?

Import.io 是我目前最好的工具,甚至是 Excel 的 SEO 工具,但它们都有自己的局限性。导入 io 很昂贵,excel 的 SEO 工具不适合提取超过 1000 个链接。

我愿意学习建议的系统,但请为我的项目提出一个好的抓取方法!

#

已解决! SEO 工具爬虫实际上非常有用,我相信我已经找到了我需要的东西。我想我会推迟 Python 或 Java,直到遇到另一个艰难的障碍。 谢谢大家!

【问题讨论】:

标签: java python xml xpath import.io


【解决方案1】:

这在很大程度上取决于您所说的“抓取信息”是什么意思。你到底想从网站上挖掘什么?所有主要语言(当然是您提到的 Java 和 Python)都有很好的解决方案来连接网站、阅读内容、使用 DOM 解析 HTML 以及使用 XPath 提取某些片段。例如,Java 有JTidy,它允许您将来自网站的“脏”HTML 解析为 DOM 并对其进行一些操作。但是,所需的工具将取决于您项目的确切数据处理需求。

【讨论】:

  • 感谢您的意见,我现在已经用 SEO 工具解决了这个问题,我将使用他们的爬虫来完美地完成我需要的工作。
【解决方案2】:

我鼓励您使用带有 Selenium 的 Python(我使用 2.7.x)。我经常使用这个组合(以有头和无头方式)自动抓取和测试网站,Selenium 解锁了与每个页面没有明确网络调用的脚本化网站交互的机会。

这是来自 Selenium 文档的一个很好的快速教程:2. Getting Started

那里有很多很棒的资源,而且要花很长时间才能将它们全部发布出来;但是,您会发现 Python 社区非常有帮助,并且您可能会发现 Python 是用于此类 Web 交互的绝佳语言。

祝你好运!

【讨论】:

  • 感谢您的意见,python 和 java 看起来都很棒.. 真的很难决定学哪一个。现在我找到了一个使用 SEO 工具爬虫的解决方案。
猜你喜欢
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 2010-12-05
  • 2015-06-09
  • 1970-01-01
  • 1970-01-01
相关资源
最近更新 更多