【发布时间】:2019-08-21 14:49:53
【问题描述】:
我有一个数据集,其中 info 列由如下字符串组成:
data['info'][0] = 'Banshidhar Roadlines - Ahmedabad Address Opp. Mahadev Avenue, Nr. Sardar Patel Ring Road, Ahmedabad Email : WebSite : City : Ahmedabad, Ahmedabad Pin Code : 382415 State : Gujarat, India Contact No. : 079- - 29292559, 65447413, GST No. : Company Registration No. : About Company Contact Person : Santram B. Yadav Mobile No. : 9376102361, 9377177197, Contact Person : Mobile No. : , , Contact Person : Mobile No. : , , Truck Available : Services : Daily Service :-Gujarat, Maharashtra, Karnataka, Rajasthan, U.P., Bihar & All Over India '
我想拆分字符串,以便我可以在自己的列中获取电子邮件、网站、城市、Pin 代码等数据。我尝试使用re.split,但字符串中有多个 Contact Person 值。
如何区分它们?
【问题讨论】:
-
您如何想要区分它们?
-
为每个“联系人”创建不同的列,例如 Contact_Person_1,Contact_Person_2...
-
在您的示例中,有三个联系人插槽,其中两个是空的。数据中的联系人是否总是存在三个“职位”?
-
是的,联系人总是有三个职位,其中一些可能包含也可能不包含数据
-
这个问题太宽泛了,特别是考虑到你只提供了一行数据,你不能合理地期望这里给出的任何答案都适用于所有 100,000 行(或者你有多少行,>> 1当然)。
标签: python regex python-3.x string pandas