【发布时间】:2014-04-07 09:03:19
【问题描述】:
我有这个 tsv 文件,其中包含一些链接路径,每个链接都由“;”分隔我想使用:
在下面的示例中,我们可以设置文件中的文本是分开的 我只想通读最后一列,它是以“14th”开头的路径
6a3701d319fc3754 1297740409 166 14th_century;15th_century;16th_century;Pacific_Ocean;Atlantic_Ocean;Accra;Africa;Atlantic_slave_trade;African_slave_trade NULL
3824310e536af032 1344753412 88 14th_century;Europe;Africa;Atlantic_slave_trade;African_slave_trade 3
415612e93584d30e 1349298640 138 14th_century;Niger;Nigeria;British_Empire;Slavery;Africa;Atlantic_slave_trade;African_slave_trade
我想以某种方式将路径拆分成这样的链:
['14th_century', 'Niger', 'Nigeria'....]
我如何读取文件并删除前 3 列所以我只得到最后一列?
更新:
我现在已经试过了:
import re
with open('test.tsv') as f:
lines = f.readlines()
for line in lines[22:len(lines)]:
re.sub(r"^\s+", " ", line, flags = re.MULTILINE)
e_line = line.split(' ')
real_line = e_line[0]
print real_line.split(';')
但问题是它没有删除前 3 列?
【问题讨论】: