【问题标题】:Regex for absolute url绝对网址的正则表达式
【发布时间】:2015-10-09 21:01:51
【问题描述】:

我正在寻找与 Python 的 re 模块兼容的正则表达式,用于查找 HTML 文档中的所有 URL,但我找不到它,除了只能检查 url 是否有效(使用 @ 987654324@ 方法)。我想做简单的

import requests
html_response = requests.get('http://example.com').text
urls = url_pattern.findall(html_response)

我认为所需的正则表达式(如果存在)足够复杂,可以考虑到一堆特殊的 url,所以它不能是一些单行代码。

【问题讨论】:

标签: python regex


【解决方案1】:

使用 BeautifulSoup 代替。它使用简单,允许您使用 HTML 解析页面。

看到这个答案How to extract URLs from an HTML page in Python

【讨论】:

    猜你喜欢
    • 1970-01-01
    • 2014-01-20
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多