【发布时间】:2020-12-08 16:59:32
【问题描述】:
所以我正在尝试使用 selenium 从网站上抓取数据,因为 selenium 和网络抓取仍然是新手,我被卡住了。我想抓取<script type> 标签下的一些数据,标签如下所示:
...
...
<script type="text/javascript">
var myData_1 = {"name" : ..... };
var myData_2 = {......};
var myData_id = 4565843;
var myData_mapping = {.....};
</script>
...
...
所以我需要抓取此脚本标记中存在的数据,即所有 var 数据值。到现在我只写了这么多:
from selenium import webdriver
import pandas as pd
driver = webdriver.Chrome('/home/slothfulwave612/chromedriver_linux64/chromedriver')
driver.get('https://www.example.com') ## not the actual site
html = driver.page_source
print(html)
driver.close()
这只是打印网站的源代码,我应该在这里添加什么,以便我可以从<script type标签中抓取数据。有人可以帮忙吗?
【问题讨论】:
-
试试
re.search('<script>(.*)</script>', html) -
它返回
None,但这对我有用content = driver.execute_script("return myData_1;")
标签: python selenium web-scraping