【发布时间】:2020-10-28 13:12:31
【问题描述】:
我正在尝试使用 python 从 rtfs 中提取超链接。我有 1000 个 rtfs 需要经过,所以我想如果这可以减轻我的任务。但是我的代码没有提取文章的链接,只是提取了该数据库的首页。这是我写的:
import csv
import re
with open('text.rtf', 'r') as file:
for line in file:
urls = re.findall('https?://(?:[-\w.]|(?:%[\da-fA-F]{2}))+', line)
print(urls)
with open ('some.csv','w') as fw:
writer = csv.writer(fw)
writer.writerows(urls)
这是打印出来的:
[]
[]
[]
['https://database.com']
[]
[]
csv 文件为空...(我想将这些 url 写入一个 csv 文件...有可能吗?)
我想这需要修改:'https?://(?:[-\w.]|(?:%[\da-fA-F]{2}))+',行'
我不知道怎么做。
【问题讨论】:
-
mathiasbynens.be/demo/url-regex 有完善的正则表达式用于 URL 捕获使用其中任何一种。
-
谢谢,我会调查的。
-
没用。可能是因为我不确定如何使用它们。我总是收到错误代码。
标签: python csv url extract rtf