【发布时间】:2018-07-31 05:15:46
【问题描述】:
我想以 hh:mm 和 h:mm 格式从我从 pdf 文件中读取的 raceresult2014 数据框中提取时间。
Team
1 Zeit/temps
2 1. Perraudin Sports II
3 8:18.21
4 Z1-S1
5 1.
6 (505)
7 2. GebSpez Abt 1 Det 1/7
8 8:34.22
9 Z1-MH1
10 1.
11 (513)
12 1.Les filles de Zinal
13 18:21.14
14 Z1-F
15 1. Courvoisier Nathalie
16 18:08.38
17 Z1-S2
预期输出
Team Time
1 Zeit/temps
2 1. Perraudin Sports II 8:18
3 8:18.21
4 Z1-S1
5 1.
6 (505)
7 2. GebSpez Abt 1 Det 1/7 8:34
8 8:34.22
9 Z1-MH1
10 1.
11 (513)
12 1.Les filles de Zinal 18:21
13 18:21.14
14 Z1-F
15 1. Courvoisier Nathalie 18:08
16 18:08.38
17 Z1-S2
到目前为止,此代码有效:
raceresult2014['Time']=raceresult2014['Team'].str.extract('(\d\d:\d\d)',expand=True)
但它只能提取 hh:mm 格式,而 h:mm 未提取。 我尝试附加另一行
onedigit=raceresult2014['Time']=raceresult2014['Team'].str.extract('(\d:\d\d)',expand=True)
raceresult2014['Time'].append(onedigit)
但现在它回到只提取 h:mm 格式并留下 hh:mm 后面。 我知道出了点问题(也许是关于复制系列 raceresult2014['Time']?)但不知道是什么。非常感谢一些帮助。谢谢!
我到处找。也许像mask for one digit and two digit 之类的python ?
【问题讨论】:
-
欢迎来到 SO。请提供minimal reproducible example。在这种情况下,一些示例数据和所需的输出将是理想的。祝你好运!
-
谢谢@jpp。我已按照您的建议编辑了问题。