【发布时间】:2020-09-01 12:19:33
【问题描述】:
我有一堆不同的银行对账单 pdf,我已将它们转换为要从中提取消费者信息的文本。我必须编写正则表达式来提取帐号。帐号后面是特定的关键字,例如:
account number,
account no,
a/c no
我将粘贴一些包含此信息的示例文本。
样本 1:
"bank of india account statement name abcd account no. 123456 account type savings account"
示例 2:
"statement for a/c no 11111111 between 16-09-2019 and 16-03-2020"
示例 3:
"shyam alaspure<br />
period<br />
01-12-2019 to 29-02-2020<br />
cust.reln.no<br />
XXXXXXXX<br />
account no<br />
9XXX99999"<br />
我使用了以下正则表达式
'account no.\s*([^.]+|\S+)'
但输出给出了帐号之后的所有文本。
请帮我找出解决办法。
【问题讨论】:
-
得到答案正则表达式应该是
r'account no.\s+((?:\w+(?:|$)){1})' -
所以,你拥有的是
account no.\s+(\w+)。但看起来它只匹配第一个输入。
标签: python python-3.x regex pandas pdftotext