【问题标题】:Nutch crawler not indexing HTML contentNutch 爬虫没有索引 HTML 内容
【发布时间】:2011-11-18 13:08:51
【问题描述】:

我正在尝试开发一种搜索功能,我可以在其中输入城市名称,它会为我提供该城市的天气状况。
我已经在我的系统上设置了 Nutch-1.3 和 Solr-3.4.0。我正在爬的网站是here,并将索引传递给Solr进行搜索。现在,我想检索this link上显示的信息,查询德里。

我怎样才能做到这一点?需要写插件吗?

 <doc><float name="score">1.0</float><float name="boost">0.1879294</float><str name="content"/><str name="digest">d41d8cd98f00b204e9800998ecf8427e</str><str name="id">http://www.imd.gov.in/section/nhac/distforecast/delhi.htm</str><str name="segment">20111118153543</str><str name="title"/><date name="tstamp">2011-11-18T10:06:45.604Z</date><str name="url">http://www.imd.gov.in/section/nhac/distforecast/delhi.htm</str></doc>

【问题讨论】:

    标签: solr web-crawler nutch


    【解决方案1】:

    Nutch 基本上是通过页面上的链接进行爬网的。
    但是,India page 上没有链接可以访问您提到的Delhi page。
    因此它无法向下导航到该页面。

    您可以创建自己的虚拟 html 页面,作为索引的起始 url,并拥有您希望 Nutch 索引的所有链接。

    架构中的默认搜索字段是什么?
    通常它是文本字段,查询德里会在该字段中查找匹配项。
    因为*:* 返回德里结果,而德里没有。它与正在搜索的字段上的索引标记不匹配。

    架构中为 url 定义的字段类型是什么?
    您可以通过文本分析将该字段复制到另一个字段,这将生成德里令牌并查询 url_copy:delhi 应该会返回结果。

    【讨论】:

    • 实际上,nutch 获取了德里页面链接,但在查询德里时,它没有显示任何结果。我用 solr 使用 ":" 返回的 XML 快照编辑了我的帖子。
    • 感谢您的回复。 url 的字段类型仅为“url”,“您可以通过文本分析将该字段复制到其他字段”是什么意思?我怎样才能做到这一点?只是为了快速检查,是否可以获取德里页面上的详细信息(降雨、温度等),因为该页面的来源有点奇怪?
    • 页面来源也有德里。它没有被索引到某个字段中吗?对于 url 在wiki.apache.org/solr/SchemaXml#Copy_Fields 找到复制字段,因此您可以使用字段类型文本创建一个新字段,搜索应该能够匹配 url。
    • 谢谢 Jayendra...我会试试的
    猜你喜欢
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2021-03-02
    • 1970-01-01
    • 1970-01-01
    • 2018-06-07
    • 1970-01-01
    相关资源
    最近更新 更多