【发布时间】:2018-10-01 19:08:16
【问题描述】:
我在 python 3.6 下使用 requests-html 包进行了爬取练习。我尝试了相关网站,但只有一个 poetryfoundation.org, https://www.poetryfoundation.org/poems/browse#page=1&sort_by=recently_added&topics=20 返回了错误的页面。我会详细演示一下。
这里是源代码,代码只是导入 requests-html 并返回包裹在中的诗歌:
从 requests_html 导入 HTMLSession
class Scrapy:
def __init__(self, session):
self.session = session
def request_content(self, url):
page = self.session.get(url)
results = page.html.find('div.c-feature')
a = True
if __name__ == '__main__':
session = HTMLSession()
scrapy = Scrapy(session)
url = 'https://www.poetryfoundation.org/poems/browse#page=1&sort_by=recently_added&topics=20'
scrapy.request_content(url=url)
无论我在url中更改什么参数,它都会返回一个错误的页面
感谢您的宝贵时间
【问题讨论】:
-
因为他们使用的是动态数据,
-
@kcorlidy 您能否提供一些有关动态数据的参考资料,或者有什么解决方案可以解决这个问题!谢谢!
-
使用 selenium 和 webdriver 应该使用 chrome(我喜欢 PhantomJS 但 selenium 不建议这样做)
标签: url web-scraping scrapy python-requests