【发布时间】:2016-03-24 05:24:14
【问题描述】:
我有一个大型数据框 (DF1),其中包含一个包含英国邮政编码数据的变量。数据中难免有一些错别字。然而,在对正则表达式进行了一些工作之后,我创建了第二个数据库,其中包含邮政编码数据的更正版本(但仅适用于原始邮政编码不正确的那些行)——DF2。 (注意,索引值不一定是连续的。)
id postcode remark
0 1 L93AP Normal
2 2 LD38AH Normal
4 3 SO224ER Normal
6 4 SO21 Too short
8 5 DN379HJ Normal
10 6 M21ORH Zero replaced with O (oh)
12 7 NP745G S replaced with 5
14 8 SE136R2 Z replaced with 2
16 9 BN251ESBN Too long
18 10 TD152EH Normal
包含更正数据的数据框是:
0 1 2 3 pcCorrected
10 M21 0 R H M210RH
12 NP7 4 S G NP74SG
14 SE13 6 R Z SE136RZ
我想合并 2 个数据库,以便 DF2 中 pcCorrected 列中的新值替换 DF1 数据框中的旧邮政编码值,但对于其他单元格,现有邮政编码值保持不变。最终的数据库应如下所示:
id postcode remark
0 1 L93AP Normal
2 2 LD38AH Normal
4 3 SO224ER Normal
6 4 SO21 Too short
8 5 DN379HJ Normal
10 6 M210RH Normal
12 7 NP74SG Normal
14 8 SE136RZ Normal
16 9 BN251ESBN Too long
18 10 TD152EH Normal
数据库非常大(>100 万行)。此操作是否有名称?最有效的方法是什么?
【问题讨论】:
标签: python python-3.x pandas dataframe