【问题标题】:Web scraping with Python and BeautifulSoup can't catch all source code使用 Python 和 BeautifulSoup 抓取网页无法捕获所有源代码
【发布时间】:2020-06-26 16:36:39
【问题描述】:

我已经看过其他关于网页抓取和python的问题了,但是有一个案例还没有答案。

通过'requests'和'BeautifulSoup'我们可以得到源代码,但是缺少了一些部分,我们怎样才能得到那些'protected'的数据呢?

因为它们存在于网站上,它们存在于源代码中,那为什么 Python 捕捉不到它们呢?

此链接上的示例:https://finance.yahoo.com/quote/AAPL 小表“公允价值”

【问题讨论】:

  • 没有“公允价值”表;这只是一个 H5 标题元素,后跟 2 个带有 SVG 的 div。

标签: python web-scraping


【解决方案1】:

他们似乎使用了一个滑块,而他们计算滑块位置的方式很可能是在后端的算法中。从他们的数据库中提取实际数据是不可能的,但也许您可以创建一个半精确的计算器来确定每个像素的权重。下面的元素是滑块中的实际刻度,其位置由 left:calc(100% - 7px) 计算。您可以根据他们的规模制作自己的规模吗?让我知道它在源代码中的位置,我会看看,我可能完全错了哈哈

<div class="Pos(a) T(-2px) W(3px) H(12px) Bdrs(4px) Bgc($primaryColor) " style="left:calc(100% - 7px);" data-reactid="199"></div>

【讨论】:

    猜你喜欢
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2016-03-22
    • 2019-05-14
    • 1970-01-01
    • 2014-08-16
    相关资源
    最近更新 更多