【问题标题】:How to Extract the texts behind the "Read More" in reviews?如何提取评论中“阅读更多”背后的文字?
【发布时间】:2020-09-23 07:44:35
【问题描述】:

This is the inspected source code image of the review

如果我在 python 中使用该类进行提取。它只返回“READ MORE”字符串,它无法获取“READ MORE”后面的文本 我的代码是,

extra = []
e = j.find_all('span', {'class' : '_1EPkIx'})
extra.append([k.get_text() for k in e])

然后它返回

[['READ MORE', 'READ MORE', 'READ MORE', 'READ MORE', 'READ MORE', 'READ MORE', 'READ MORE', 'READ MORE']]

你对此有什么想法吗???

【问题讨论】:

  • 你必须使用 selenium 来自动化这件事。

标签: python web-scraping beautifulsoup python-requests-html


【解决方案1】:

这种 javascript 事件由 selenium 处理,但不是 beautifulsoup。

import selenium
selenium.webdriver.find_element_by_css_selector('span._1EPkIx').click()

之后你可以获取 webdriver.page_source 并且假设是整个文本

【讨论】:

    猜你喜欢
    • 2012-05-11
    • 2015-09-28
    • 1970-01-01
    • 2019-02-18
    • 1970-01-01
    • 2014-04-24
    • 2014-10-10
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多