【问题标题】:Python - web crawling / different result from same code? / requests, bs4 / M1Python - 网络爬行/来自相同代码的不同结果? /请求,bs4 / M1
【发布时间】:2021-05-14 18:39:40
【问题描述】:

我正在学习 python 进行网络爬虫,但我完全卡住了。

每次我运行这段代码,结果都会改变。

很少,它可以工作,但几乎返回空列表。

为什么会这样?请告诉我

from indeed import extract_indeed_pages, extract_indeed_jobs


last_indeed_page = extract_indeed_pages()

print(last_indeed_page)

indeed_jobs = extract_indeed_jobs(last_indeed_page)

print(indeed_jobs)

import requests
from bs4 import BeautifulSoup

LIMIT = 50
URL = f"https://kr.indeed.com/jobs?q=React&l=%EC%84%9C%EC%9A%B8&radius=100&jt=fulltime&limit={LIMIT}"


def extract_indeed_pages():
    result = requests.get(URL)
    soup = BeautifulSoup(result.text, "html.parser")
    pagination = soup.find("div", {"class": "pagination"})

    links = pagination.find_all('a')
    pages = []
    for link in links[:-1]:
        pages.append(int(link.string))

    max_page = pages[-1]
    return max_page


def extract_indeed_jobs(last_page):

    jobs = []
    
    result = requests.get(f"{URL}&start={0*LIMIT}")
    soup = BeautifulSoup(result.text, "html.parser")
    results = soup.find_all("h2", {"class": "jobTitle"})
    jobs.append(results)

    return jobs

【问题讨论】:

    标签: python beautifulsoup python-requests web-crawler


    【解决方案1】:

    这是因为源代码中的 javascript。您可以按电脑上的ctrl + u 按钮查看网页。

    【讨论】:

    • 感谢您的回答。但我无法得到它。请解释更多细节。我的代码中有 JS 代码吗?我应该在哪里按crtl + U?在视觉工作室代码中?还是终端?
    猜你喜欢
    • 2021-08-23
    • 1970-01-01
    • 1970-01-01
    • 2013-08-23
    • 1970-01-01
    • 2016-11-08
    • 1970-01-01
    • 2018-04-23
    • 2020-12-15
    相关资源
    最近更新 更多