【发布时间】:2021-05-29 23:27:01
【问题描述】:
这是我试图通过页面https://stellar.expert/explorer/public/asset/native?cursor=15297&filter=asset-holders 完成的工作
- 提取表格列(账户和账户余额)中的数据
- 将提取的数据字段写入文本文件。
- 我正在尝试提取多个页面,例如从 15297 到 15500。
我对 python 和网络抓取仍然很陌生,我一直在努力获得所需的输出。帮助将不胜感激。谢谢。
from bs4 import BeautifulSoup
try:
import urllib.request as urllib2
except ImportError:
import urllib2
from time import sleep
url = 'https://stellar.expert/explorer/public/asset/native?cursor=15297&filter=asset-holders'
page = urllib2.urlopen((url))
soup = BeautifulSoup(page, 'html.parser')
for div in soup.find_all('div', attrs={'class': 'table exportable space'}):
address = div.find('tbody', attrs={'class': "account-address"})
address = address.text.strip()
print (address)
bal = div.find('tbody', attrs={'class': "text-right nowrap"})
bal = bal.text.strip()
print (balance)
print ("%s%s\n" % ("page=", str(URL)))
我想写入的输出(result.txt):
GBMN2KIUQS66JMJHVOCA7N3S35F4F5PTY63XG3BJKKDMLPI4HPHA7QNU: 27,005 XLM
GBWVMIVJQNILFPHACV4Q7QM7VBOOQ35IQXEOOXO7WBXA4KX7OEADOU65: 27,004 XLM
GD3UXDHKS5EIKSL3PIG3NTVCCK5EQX73JMFJBFBROX3BAZ4K6437TZAC: 27,003 XLM
GBYUHMDQYNNDMJWOVODTZUKWOTVJXA2PCTDOF6J5NQS5DGMMJAL6B66L: 27,002 XLM
GDD3AQFXWWHWEFAOU4AWPZCT3Q6EVK4WYHWSG2EBQB3Z43KZSXJEK6WB: 27,001 XLM
【问题讨论】:
-
页面加载了javascript,您可以检查页面并查看它们是否有api,如果有,请提出请求。另一种方法是使用硒
-
正确的术语是“刮”。报废意味着扔掉。
标签: python web web-scraping beautifulsoup