【问题标题】:scrapy same url different source content抓取相同的网址不同的源内容
【发布时间】:2016-01-22 13:41:24
【问题描述】:

我在以下网站上使用 scrapy 来获取足球比赛 URL。 http://www.spox.com/de/daten/?sport=soccer&page=season&id=9643&view=matches

到目前为止,它使用了显示的 25 个匹配项的所有 URL,但是有一个“返回”(“Zurück”)按钮来显示更多匹配项,但它使用相同的 URL。那么我如何告诉 scrapy 按下该按钮并获取匹配的 URL?

【问题讨论】:

    标签: scrapy


    【解决方案1】:

    当按下返回按钮时,浏览器会生成一个XMLHttpRequest。我建议在按下后退按钮后启动浏览器的控制台并检查网络流量。您将看到页面从中获取数据的 url。使用该网址进行进一步抓取。

    【讨论】:

    • 或者使用 Splash (github.com/scrapinghub/splash) 渲​​染页面并点击按钮。但在这种情况下,逆向工程可能更容易、更快。
    猜你喜欢
    • 2019-02-20
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2019-11-21
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2015-10-16
    相关资源
    最近更新 更多