【发布时间】:2016-02-09 18:43:14
【问题描述】:
我正在开展一个项目,该项目需要识别公司网站上的联系点并用于增强安全性。
现在,我设法使用 Apache Nutch 抓取了几轮网站。下一步将是解析 HTML 页面并找到联系信息的位置。在这种情况下,我只对电子邮件地址和电话号码感兴趣....
这是我打算做的,我们可以编写一个 map reduce 作业来解析 HTML 文件,并使用正则表达式之类的东西与 Jsoup/Beautifulsoup HTML 解析器组合来查找正则表达式。
但是,我想知道是否有任何解析器插件已经实现并可能用于此目的的测试?
【问题讨论】: