【发布时间】:2018-06-10 10:02:32
【问题描述】:
我正在尝试使用正则表达式从 .txt 文件中提取 URL(所有 URL 都以 .jpeg 结尾)。这是我的正则表达式:
import re
output = re.findall('(http)(.*?)(jpeg)', text)
但我的输出如下所示:
('http', ://d1spq65clhrg1f.cloudfront.net/uploads/image_request/image/182/182382/182382534/cloudsight.', 'jpeg')
如何避免用逗号分隔匹配项?
【问题讨论】:
-
添加样本数据并输出
-
是否要求您只捕获以“.jpeg”结尾的 URL?或者其他结尾也有效,例如“.jpg”或“.gif”或根本没有扩展名?如果是这样,您能否在问题中更清楚地说明这一点?
标签: python regex url pattern-matching