【发布时间】:2018-03-14 20:04:05
【问题描述】:
我正在刮https://www.shiksha.com/b-tech/colleges/b-tech-colleges-mumbai-all收集大学信息。
在每个学院下方的网页上,仅给出一个课程名称,其余课程均使用 JavaScript 编写脚本。 例如。 +13 更多课程+
所以当我使用 requests.get(url) 时,我没有得到他们的信息。
如何使用 REQUESTS 和 BeautifulSoup 抓取这些细节? 我使用 Anaconda Jupyter Notebook 作为 IDE。
我听说过 Selenium,但不知道。 由于 Selenium 有点重,是否有任何可能的 lite 替代方法来一次加载所有 JavaScript 内容。
我也听说过 Splash 框架。如果有人知道它以及如何将它与 Python Requests 和 BeautifulSoup 集成,请回答。
我尝试过的事情
1.PyQt
参考:https://www.youtube.com/watch?v=FSH77vnOGqU
根据 anaconda 中的 PyQt 版本,我导入了与视频中不同的库。
import sys
from PyQt5.QtWidgets import QApplication
from PyQt5.QtCore import QUrl
from PyQt5.QtWebKitWidgets import QWebPage
import requests
from bs4 import BeautifulSoup
class Client(QWebPage):
def __init__(self, url):
self.app = QApplication(sys.argv)
QWebPage.__init__(self)
self.loadFinished.connect(self.on_page_load)
self.mainFrame().load(QUrl(url))
self.app.exec_()
def on_page_load(self):
self.app.quit()
url="https://www.shiksha.com/b-tech/colleges/b-tech-colleges-mumbai-all"
client_response=Client(url)
src=client_response.mainFrame().toHtml()
soup = BeautifulSoup(src,"lxml")
tpm = soup.find_all("section",{"class":"tpl-curse-dtls more_46905_0"})
print(tpm)
输出:[]
2。请求模块中的 json()
import requests
from bs4 import BeautifulSoup
url="https://www.shiksha.com/b-tech/colleges/b-tech-colleges-mumbai-all"
r=requests.get(url)
a=r.json()
输出: JSONDecodeError:期望值:第 3 行第 1 列(字符 3)
3.来自 json 模块的 json.loads()
Inspection Details on clicking
import json
j_url='https://www.shiksha.com//nationalCategoryList/NationalCategoryList/loadMoreCourses/'
def j_data(url=j_url):
dt = tp[0].find_all("input",{"id":"remainingCourseIds_46905"})
output = dt[0]['value']
data = {
'courseIds': '231298,231294,231304,231306',
'loadedCourseCount': 0
#'page':page
}
response = requests.post(url, data=data)
return json.loads(r.content)
print(j_data())
输出: JSONDecodeError:期望值:第 3 行第 1 列(字符 3)
DRYSCRAPE 不适用于 Windows
【问题讨论】:
-
用你的代码试验更新问题。
-
@DebanjanB 用我的代码试验更新了这个问题。
标签: python selenium web-scraping beautifulsoup python-requests