【发布时间】:2017-02-19 04:12:09
【问题描述】:
我有一个 33620x160 pandas DataFrame,其中有一列包含数字列表。 DataFrame 中的每个列表条目包含 30 个元素。
df['dlrs_col']
0 [0.048142470608688, 0.047021138711858, 0.04573...
1 [0.048142470608688, 0.047021138711858, 0.04573...
2 [0.048142470608688, 0.047021138711858, 0.04573...
3 [0.048142470608688, 0.047021138711858, 0.04573...
4 [0.048142470608688, 0.047021138711858, 0.04573...
5 [0.048142470608688, 0.047021138711858, 0.04573...
6 [0.048142470608688, 0.047021138711858, 0.04573...
7 [0.048142470608688, 0.047021138711858, 0.04573...
8 [0.048142470608688, 0.047021138711858, 0.04573...
9 [0.048142470608688, 0.047021138711858, 0.04573...
10 [0.048142470608688, 0.047021138711858, 0.04573...
我正在创建一个 33620x30 数组,其条目是来自该单个 DataFrame 列的未列出值。我目前正在这样做:
np.array(df['dlrs_col'].tolist(), dtype = 'float64')
这很好用,但需要大量时间,尤其是考虑到我对另外 6 列列表进行类似计算时。关于如何加快速度的任何想法?
【问题讨论】:
标签: python arrays performance pandas numpy