【发布时间】:2021-06-03 22:21:12
【问题描述】:
我正在用 Beautiful Soup 做很多工作。但是,我的主管不希望我通过网络“实时”完成工作。相反,他希望我从网页下载所有文本,然后再进行处理。他想避免网站上的重复点击。
这是我的代码:
import requests
from bs4 import BeautifulSoup
url = 'https://scholar.google.com/citations?user=XpmZBggAAAAJ'
page = requests.get(url)
soup = BeautifulSoup(page.text, 'lxml')
我不确定是否应该将“页面”保存为文件,然后将其导入 Beautiful Soup,或者是否应该将“汤”保存为文件以供稍后打开。我也不知道如何以一种可以像从 Internet 上“实时”访问的方式将其保存为文件。我对 Python 几乎一无所知,所以我需要一个绝对最简单和最简单的过程。
【问题讨论】: