【问题标题】:Web scraping from strong tag从强标签中抓取网页
【发布时间】:2021-07-06 16:46:00
【问题描述】:

如何从强标签中提取数据?

HTML code:
<div class="store-views"><span class="caption">VISIT COUNT</span><br><strong>336</strong></div>

我尝试过 soup.find("strong") 和 soup.find("div", class_="store-views") 但它要么提供了错误的数据要么“无”

【问题讨论】:

  • soup.select_one(".store-views strong").text 应该可以工作。芽print(soup.prettify()) 显示标签在那里?
  • 仍然显示 'NoneTpe' 对象没有属性 'text'
  • 执行print(soup.prettify()) 并检查&lt;strong&gt; 标签是否存在。它可能是通过 Javascript 注入的,beautifulsoup 看不到它。
  • 是的,当我执行 print(soup.prettify()) 时它不显示
  • 有网址可以分享吗?

标签: python html beautifulsoup tags


【解决方案1】:

该值是动态添加的,可能来自谷歌分析。您可以使用 selenium 自动化浏览器,以便在添加时捕获此值:

from selenium import webdriver

d = webdriver.Chrome()
d.get('https://store.bricklink.com/legoseller9997&utm_content=globalnav#/shop')
print(d.find_element_by_css_selector('.store-views strong').text)
d.quit()

其他数据来自一个ajax请求:

import requests

r = requests.get('https://store.bricklink.com/ajax/clone/store/searchitems.ajax?showHomeItems=1&sid=1663355', headers= {'User-Agent':'Mozilla/5.0'}).json()
print(r)

【讨论】:

    猜你喜欢
    • 1970-01-01
    • 2020-08-28
    • 1970-01-01
    • 2022-07-01
    • 2014-05-11
    • 2020-09-30
    • 2019-12-04
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多