【问题标题】:How to extract text from hyperlink using python?如何使用python从超链接中提取文本?
【发布时间】:2022-08-18 22:59:12
【问题描述】:

现在我正在尝试验证它是否损坏并在 Excel 表中进行更新。为此,我需要从超链接中获取该文本,以便该链接易于理解。

他们将在 Excel 表中提供所有链接。

Link
https://www.dailythanthi.com/Careers 
https://www.dailythanthi.com/Paper-Ad-Tariff

我需要像这样解析这个内容到excel表

Link                               text                           response code
https://www.dailyt...        Careers                                   200
https://www.dailyt...        Paper Advertisement                       404

是否可以从他们提供的链接中提取文本链接?

  • 是的,您可以与我们分享您的 Excel 表格吗
  • IIUC 你想访问所有网站,获取标题和响应代码并用它创建一个新的 csv?
  • 如果您想为此获得解决方案,请告诉我您的问题可能随时关闭,因此无法回答,请通过 masterhimanshupoddar@gmail.com 与我联系
  • text.split(\"/\') 怎么样? IE。 \"https://www.dailythanthi.com/Careers\".split(\'/\')[3] 给 Careers。但使用模块urllib.parse 解析url 并拆分它可能会更好。

标签: python excel web-scraping beautifulsoup scrapy


【解决方案1】:

如果您想直接从 Google 电子表格中获取文本,可以使用包 google_spreadsheet,或者您可以下载它,将其转换为 csv 并使用 csv 库对其进行操作。

为了获取响应代码,您可以使用:

import requests
response = requests.get('website_url')
print(str(response)[11:14])

之后,获得标题:

from bs4 import BeautifulSoup
soup = BeautifulSoup(response.text, 'html.parser')
for title in soup.find_all('title'):
    print(title.get_text())

【讨论】:

    【解决方案2】:

    链接是string,因此您可以在 Python 中使用string functions 来使用它。

    例如,您可以使用.split('/')

    links = [
      "https://www.dailythanthi.com/Careers",
      "https://www.dailythanthi.com/Paper-Ad-Tariff",
    ]
    
    for item in links:
        print( item.split("/")[3] )
    

    结果:

    Careers
    Paper-Ad-Tariff
    

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 2022-08-16
      • 2016-08-26
      • 2017-10-22
      • 2020-10-28
      • 1970-01-01
      • 2016-02-12
      • 2020-03-26
      • 1970-01-01
      相关资源
      最近更新 更多