【问题标题】:Beautiful soup some errors美丽的汤有些错误
【发布时间】:2021-12-26 17:26:43
【问题描述】:

所以,我只是为一个人事项目为亚马逊制作了一个网络抓取工具,但我遇到了一个问题,即每当我使用 get_text 时,它都会显示属性错误,但它在我所指的视频中工作得非常好我不是在做了。 在我没有使用标题之前,但后来它让我觉得它可能有问题,所以我复制了它,因为它是教练在视频教程中写的。

import requests
from bs4 import BeautifulSoup
URL="https://www.amazon.in/dp/B074WZJ4MF/ref=redir_mobile_desktop?_encoding=UTF8&aaxitk=8bc2212eee66e1c1bdca057df16f612f&hsa_cr_id=2722802130102&pd_rd_plhdr=t&pd_rd_r=135b3806-45ad-402d-9df7-0f14d458f874&pd_rd_w=19o2S&pd_rd_wg=TBmei&ref_=sbx_be_s_sparkle_mcd_asin_0_title"
HEADERS={"Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/96.0.4664.110 Safari/537.36"}

def getprice():
    page= requests.get(URL, headers=HEADERS)

    # print(htmlcontent)
    soup=BeautifulSoup(page.content,'html.parser')
    # print(soup.prettify)
    title=soup.find(id="productTitle").get_text()
    
    print(title)

if __name__=="__main__":
    getprice()

代码如下: IDK 为什么会这样,让我也向您展示一下输出: The Output

链接只是一个随机获取的链接,获取的 id 是我希望它显示的产品的标题。 请帮助我在整个互联网上搜索它。

【问题讨论】:

    标签: python python-3.x beautifulsoup


    【解决方案1】:

    您的 HEADERS 变量是一个字典。您应该正确设置 User-Agent 密钥。

    HEADERS={"User-Agent":"Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/96.0.4664.110 Safari/537.36"}
    

    【讨论】:

      【解决方案2】:

      如果您正在寻找获得解决方案的简单方法。你可以用硒刮

      这里是代码。

      driver= webdriver.Chrome("C:/chromedriver.exe")
      url='https://....."
      driver.get(url)
      price= driver.find_element_by_xpath("//span[@class='a-price a-text-price a-size-m 
      edium apexPriceToPay']").text
      

      【讨论】:

        猜你喜欢
        • 1970-01-01
        • 1970-01-01
        • 1970-01-01
        • 1970-01-01
        • 1970-01-01
        • 1970-01-01
        • 1970-01-01
        • 1970-01-01
        • 2019-01-26
        相关资源
        最近更新 更多