【发布时间】:2022-11-23 23:41:52
【问题描述】:
我正在做一个项目,我必须从 url= "https://www.screener.in/company/ITC/consolidated/" 的源代码中获取 '6596626'。 该值在网页上不可见,因此很难使用 xpath 提取。 下面的代码是页面源代码的一部分,它具有我想要提取的值。
<div
data-company-id="1552"
data-warehouse-id="6596626"
data-user-is-registered="true"
data-consolidated="true"
id="company-info">
</div>
这是我试过的代码,我希望直接从源代码中提取值,但没有结果。
from urllib import request
from bs4 import BeautifulSoup
from lxml import etree
symbol=input("Enter symbol of the company\n")
response = request.urlopen("https://www.screener.in/company/"+symbol+"/consolidated/")
page_source = response.read().decode('utf-8')
soup=BeautifulSoup(page_source,'html.parser')
id=soup.get_text('data-warehouse-id')
print(id)
【问题讨论】:
标签: web-scraping beautifulsoup