【发布时间】:2013-05-29 08:30:31
【问题描述】:
我已将数据从一个来源提取到 .txt 文件。源是某种地址簿,我使用宏记录器进行提取。现在我有几个完全按照下一种方式格式化的文件(例如 4 个联系人):
Abbrucharbeiten
ATR Armbruster
Werkstr. 28
78727 Oberndorf
Tel. 0175 7441784
Fax 07423 6280
Abbrucharbeiten
Jensen & Sohn, Karl
Schallenberg 6A
25587 Münsterdorf
Tel. 04821 82538
Fax 04821 83381
Abbrucharbeiten
Kiwitt, R.
Auf der Heide 54
48282 Emsdetten
Tel. 02572 88559
Tel. 0172 7624359
Abbrucharbeiten, Sand und Kies, Transporte, Kiesgruben, Erdbau
Josef Grabmeier GmbH
Reitgesing 1
85560 Ebersberg
Tel. 08092 24701-0
Fax 08092 24701-24
第一行始终是业务的字段(名称) 第二行始终是公司/公司的名称 第三排总是街道地址 第 4 行始终是邮政编码和地点 进而 第 5 行和接下来的几行(有时是两行,有时更多)是 eithar Tel。或传真。
我想对其进行格式化,使其类似于 excel 表,例如:
Branche: Name: Address: Place: contact1: contact2:
1st row 2nd row 3rd row 4th row 5th row 6th row.....
现在主要问题是我有超过 500.000 个联系人,我的主要问题是最后一个字段并不总是相同的数字...我不想手动操作,请帮助我...
【问题讨论】:
-
那么你想写一些代码来做提取吗?
-
如果有可能用一些代码来解决这个问题而不是肯定的,我对 python 和 vbs 有一些经验,但没有那么多解决这个问题
-
是的,每个
name都有一个Branche虽然branche并不总是相同,在上面的示例中您可以看到,有时它只是一个项目,有时它是几个项目,因为例如,有时只是'Abbrucharbeiten'或'Transporte',有时是'Abbrucharbeiten, Transporte'