【发布时间】:2019-08-30 12:48:09
【问题描述】:
我正在尝试从该网站上抓取各个玩家的网址。
我已经尝试使用 bs4 执行此操作,并且每次我尝试查找表时它都会返回 []。切换到 lxml 尝试一下。
import urlopen from urllib.requests
import lxml.html
url = "https://www.espn.com/soccer/team/squad/_/id/359/arsenal"
tree = etree.HTML(urlopen(url).read())
table = tree.xpath('/*
[@id="fittPageContainer"]/div[2]/div[5]/div[1]/div/article/div/section/div[5]/section/table/tbody/tr/td[1]/div/table/tbody/tr[1]/td/span')
print(table)
我希望可以使用某种排序输出来获取链接,但代码返回方括号
【问题讨论】:
-
我认为那里的所有数据都是通过 Javascript 作为 JSON 加载的,然后通过 Javascript 映射到 HTML 表。
标签: html python-3.x lxml elementtree