【发布时间】:2016-06-22 23:54:04
【问题描述】:
我正在对包含 URL 的字符串进行标记。这是我用来获取 URL 的部分:
regex_str = [r'http[s]?://(?:[a-z]|[0-9]|[$-_@.&+]|[!*\(\),]|(?:%[0-9a-f][0-9a-f]))+']
它可以很好地提取“常规”网址;但是一些 URL 看起来像这样:
https:\/\/t.co\/c1taPXzi4X
如何修改正则表达式以处理转义字符,从而获得完整且干净的 URL?
提前非常感谢! :)
【问题讨论】:
标签: python regex token tokenize