【发布时间】:2021-02-06 14:58:47
【问题描述】:
我正在尝试为分析项目提取高尔夫统计数据。
TL;DR 总结: 我应该使用在网络控制台中找到的 API 抓取还是使用循环?
我想提取 6 或 7 个统计类别的数据,按年份(2015 年至今),最好按锦标赛,以更好地对玩家锦标赛表现进行分类。
基本网址为:https://www.pgatour.com/stats
该网站有许多页面,一旦您点击特定的统计页面,它就会有三个下拉字段: 赛季(包含年份)、时间段(仅限锦标赛或 YTD)和锦标赛(锦标赛名称)
找到可能的隐藏 API:
https://statdata-api-prod.pgatour.com/api/clientfile/YTDEventStats?T_CODE=r&STAT_ID=02671&YEAR=2021&format=json
但这只有最近一场锦标赛的数据,而且不是很干净(表格数据没有统计类别标题):
我可以通过更改 Stat ID=value 和年份来调整 JSON API。所以这是一个选项,但我必须弄清楚如何仅将锦标赛 ID 号和锦标赛统计数据添加为键值对。
示例的 URL 如下所示:https://www.pgatour.com/content/pgatour/stats/stat.02674.y2017.eon.t030.html
eon 仅进行统计锦标赛(eoff 用于 YTD),t030 是锦标赛标记。
我是否应该只创建循环并更改年份、锦标赛编号和统计编号并以 JSON 格式获取所有信息并尝试将其放入 df 中?
- 如何将锦标赛和 eon 限定符添加为 JSON url 中的键值对?
- 这甚至可行吗?
或者我应该刮掉它并尝试使用 HTML(可能能够捕获统计行标题)?
包含来自网站的一张表的快照
【问题讨论】:
标签: python api web-scraping