【问题标题】:Scraping stopping at first line刮停在第一行
【发布时间】:2018-05-10 18:36:03
【问题描述】:

我需要废弃一个网站以获取一些信息,例如电影的标题和相关链接。我的代码运行正确,但它停在网站的第一行。这是我的代码,提前感谢您的帮助,如果这不是一个聪明的问题,我很抱歉,但我是新手。

import requests

from bs4 import BeautifulSoup

URL= 'http://www.simplyscripts.com/genre/horror-scripts.html'

def scarica_pagina(URL):
    page = requests.get(URL)
    html = page.text
    soup = BeautifulSoup(html, 'lxml') l
    films = soup.find_all("div",{"id": "movie_wide"})
    for film in films:
        link = film.find('p').find("a").attrs['href']
        title = film.find('p').find("a").text.strip('>')
        print (link)
        print(title)

【问题讨论】:

  • 告诉网站网址
  • 这里的一切看起来都很好。听起来你有一个依赖于网站的问题。
  • 您可以将链接发布到该网站并通过编辑您的问题来完成
  • 我做到了,谢谢!
  • 只有一个div#movie_wide 和多个ps 包含as。

标签: python web-scraping beautifulsoup screen-scraping


【解决方案1】:

试试下面的方法。我稍微修改了您的脚本以达到目的并使其看起来更好。如果您遇到任何其他问题,请告诉我:

import requests
from bs4 import BeautifulSoup

URL = 'http://www.simplyscripts.com/genre/horror-scripts.html'

def scarica_pagina(link):
    page = requests.get(link)
    soup = BeautifulSoup(page.text, 'lxml')
    for film in soup.find(id="movie_wide").find_all("p"):
        link = film.find("a")['href']
        title = film.find("a").text
        print (link,title)

if __name__ == '__main__':
    scarica_pagina(URL)

【讨论】:

    猜你喜欢
    • 1970-01-01
    • 1970-01-01
    • 2014-12-04
    • 2016-07-28
    • 1970-01-01
    • 1970-01-01
    • 2023-04-09
    • 1970-01-01
    • 2012-07-16
    相关资源
    最近更新 更多