【发布时间】:2014-04-04 12:14:35
【问题描述】:
假设我想抓取这个页面:https://twitter.com/nfl
from bs4 import BeautifulSoup
import requests
page = 'https://twitter.com/nfl'
r = requests.get(page)
soup = BeautifulSoup(r.text)
print soup
我在页面上向下滚动的次数越多,显示的结果就越多。但是上面的这个请求只给了我初始负载。如何像手动向下滚动一样获取页面的所有信息?
【问题讨论】:
-
你好,我和你的情况类似,我的建议是学习一点js(这就是我现在正在做的)。您实际上可以使用适当的参数调用js文件,使其直接将数据输出到文件(最有可能是json)。但由于我现在正在学习它,我无法提供更好的解决方案。如果我错了,请纠正我。我正在处理的案例是 stocktwits.com/symbol/aapl 。我希望它会给你一点。
标签: python twitter web-scraping beautifulsoup