【发布时间】:2015-10-09 21:01:51
【问题描述】:
我正在寻找与 Python 的 re 模块兼容的正则表达式,用于查找 HTML 文档中的所有 URL,但我找不到它,除了只能检查 url 是否有效(使用 @ 987654324@ 方法)。我想做简单的
import requests
html_response = requests.get('http://example.com').text
urls = url_pattern.findall(html_response)
我认为所需的正则表达式(如果存在)足够复杂,可以考虑到一堆特殊的 url,所以它不能是一些单行代码。
【问题讨论】:
-
不要使用正则表达式来解析 html。改用BeautifulSoup(或html parser in the standard lib)