【发布时间】:2016-06-01 10:34:08
【问题描述】:
我会在我的 Java 应用程序中使用 Apache Nutch 来抓取一个或多个网站的网页。基本上,我需要为网络爬虫找到的每个网页调用我的 Java 应用程序的一个方法,以便处理页面内容(文本等)。如何做到这一点?
【问题讨论】:
-
请参阅我在其他地方发布的相关答案:stackoverflow.com/questions/10007178/…
标签: java web-crawler nutch