【发布时间】:2018-08-15 14:33:53
【问题描述】:
我想根据 pandas.Dataframe 中包含字母数字字符串的一列计算多个特征。
我想根据这些字符串中的每一个计算新值,例如字母、数字、元音和辅音字符的比率。因为我有数百个数百万个字符串,所以我想找到计算这些值的最有效方法。
目前我正在为我的pandas.DataFrame df 和列domain 计算它:
alphabet = list("abcdefghijklmnopqrstuvwxyz")
fn = lambda row: sum(row.domain.count(a) for a in alphabet) / len(row.domain)
df.assign(alphabetic_ratio=df.apply(fn, axis=1).values)
目前我对数字、元音和辅音比率采用相同的方案,但由于字符串的数量需要很长时间来计算(字母比率 6 小时以上)。
我不确定我是否在解释为什么要花这么多时间做任何明显错误的事情,或者是否可以实施任何技巧来加快计算速度。
我知道将代码转换为C 并使用cython 可能会缩短时间,但我想首先探索真正的pythonic 解决方案。如果有人能告诉我它肯定会改善时间尺度,我会尝试一下。
我尝试了其他方法来确定字符是否为字母,例如检查ord(a) 数字或`a.isalpha()',但时间相同。
【问题讨论】: