【问题标题】:Crawl and index specific html tags with NUTCH and Solr使用 NUTCH 和 Solr 抓取和索引特定的 html 标签
【发布时间】:2016-07-27 12:54:22
【问题描述】:

我现在正在爬一个网站,比如汽车易趣,www.standvirtual.com

在我的 nutch regex-urlfilter.txt +^http://([a-z0-9]*.)*standvirtual.com/carros/anuncios/ 像这样只是抓取汽车的广告,但像这样 nutch 会索引页面的全部内容,我只是想索引该页面的特定部分,例如添加的标题、描述等...

示例: 让我们想象一个标题是奥迪 a3 2.0cc 的场景 和奥迪 a3 2000cc 交流,柴油...

【问题讨论】:

标签: html solr nutch


【解决方案1】:

您必须覆盖 parsefilter 并使用 Jsoup 选择器来选择要抓取和索引的部分。 看看这个https://stackoverflow.com/a/38854219/5676586

【讨论】:

    猜你喜欢
    • 1970-01-01
    • 2015-11-22
    • 2016-12-22
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2012-11-05
    • 1970-01-01
    相关资源
    最近更新 更多