【问题标题】:Import IO- Using XPath to show "more" content导入 IO - 使用 XPath 显示“更多”内容
【发布时间】:2015-07-13 15:02:58
【问题描述】:

我完全被这件事难住了,向我们寻求帮助!

我正在使用 Import.io 爬虫从 TripAdvisor 提取评论。但是,当我训练爬虫时,“更多”按钮处于非活动状态。

这是一个页面示例:[http://www.tripadvisor.co.uk/Hotel_Review-g295424-d306662-Reviews-Hilton_Dubai_Jumeirah_Resort-Dubai_Emirate_of_Dubai.html#REVIEWS][1]

这里是完整评论的 Xpath://*[@id="UR288083139"]/div[2]/div/div[3]

然后到“更多”按钮: //*[@id="review_288083139"]/div[1]/div[2]/div/div/div[3]/p/span

是否可以有一个 Xpath 以便完整的评论包含在 Import.io 中?

【问题讨论】:

    标签: xpath web-crawler import.io


    【解决方案1】:

    您可以做到这一点的一种方法是使用 Crawler 然后使用 Extractor。这会将流程分成两部分。

    1. 创建一个抓取工具,您将对其进行训练以捕获页面上每条评论的链接。确保为列选择链接。

      Sample review from the website

    2. 创建一个提取器以从您从爬虫获取的链接中获取完整评论。

    3. 瞧!您获得了所有评价!

    注意:如果您已经拥有需要评论的页面的所有链接,最好制作提取器而不是爬虫。这样,您可以将 API 链接到其他提取器。如果您不知道所有链接,您只需要一个爬虫。

    希望这会有所帮助!

    【讨论】:

      【解决方案2】:

      在您单击该按钮之前,该 html 似乎不在页面上,并且没有包含该数据的 URL。所以你可能不走运。

      您可以尝试使用开发人员控制台来查看是否可以在某个位置找到隐藏在 xml 文件或动态 URL 中的完整评论。我不确定如何。

      【讨论】:

        猜你喜欢
        • 1970-01-01
        • 1970-01-01
        • 1970-01-01
        • 2014-12-04
        • 1970-01-01
        • 1970-01-01
        • 2015-03-10
        • 1970-01-01
        • 2013-08-10
        相关资源
        最近更新 更多