【发布时间】:2014-04-02 23:32:18
【问题描述】:
我正在尝试提取以下信息:
在页面上
http://epl.squawka.com/stoke-city-vs-arsenal/01-03-2014/english-barclays-premier-league/matches
按下红色的“完整统计”按钮会打开一个菜单,其中包括(在左侧)“交叉”按钮。这将在屏幕右侧打开一个带有 19 个箭头的足球场图像,这些是斯托克在斯托克-阿森纳比赛中的传中。它们是彩色编码的,红色 = 未完成,绿色 = 完成,黄色 = 关键通行证。 当你点击一个箭头时,它会告诉你是谁传球的以及在比赛的哪一分钟。 此外,箭头还显示了球员在传球时的站立位置以及被传球的球员所在的位置。
我希望能够抓取此页面,以便获得包含列的表格:
团队;发件人姓名;发件人位置;接收者位置;分钟;箭头颜色
这是斯托克队的传球,我也想自动为阿森纳重复这个(因此,上表中的“俱乐部”列)。
虽然我过去曾抓取过网页,但这些都是静态的相当简单的页面,我完全不知道如何从这个页面上抓取信息。 我非常感谢有关如何抓取我刚才描述的数据的帮助。我精通 R,因此我特别感谢能帮助我在 R 中实现这一目标的代码,但我也非常感谢使用其他语言或软件的帮助。
谢谢你, 彼得
【问题讨论】:
-
您可能必须使用浏览器驱动程序,例如 Selenium。有R接口;见lluisramon.github.io/relenium 和johndharrison.github.io/RSelenium。
-
我从来没有听说过这样的事情,新作业!我将如何在 squawka 使用它来抓取像这样的页面?有什么提示吗?
标签: python r python-2.7 web-scraping screen-scraping