访问 Pandas DataFrame 的最快方法是什么？答案

【问题标题】：What's the fastest way to acces a Pandas DataFrame?访问 Pandas DataFrame 的最快方法是什么？
【发布时间】：2017-12-11 03:38:59
【问题描述】：

我有一个包含 541 列的 DataFrame df，我需要将其列名的所有唯一对保存到单独 DataFrame 的行中，每行重复 8 次。

我想我会创建一个空的 DataFrame fp，对 df 的列名进行双重循环，每 8 行插入一次，然后用最后一个可用值填充空白。

当我尝试执行此操作时，我对花费多长时间感到困惑。有 541 列，我只需要写 146,611 次，但它需要 20 多分钟。这对于仅数据访问来说似乎是令人震惊的。问题出在哪里，我该如何解决？ Pandas 用列生成相关矩阵所需的时间比这要少，所以我必须做错事。

这是我的意思的可重复示例：

fp = np.empty(shape = (146611, 10))
fp.fill(np.nan)

fp = pd.DataFrame(fp)

%timeit for idx in range(0, len(fp)): fp.iloc[idx, 0] = idx

# 1 loop, best of 3: 22.3 s per loop

【问题讨论】：

标签： python pandas

【解决方案1】：

截至 2020 年 1 月 6 日，当使用 .is_numpy() 而不是 .values 时，Alexander 的回答对我来说是最快的。在 Windows 10 上的 Jupyter Notebook 中测试。Pandas 版本 = 0.24.2

import numpy as np 
import pandas as pd
fp = np.empty(shape = (146611, 10))
fp.fill(np.nan)
fp = pd.DataFrame(fp)
pd.__version__ # '0.24.2'

def func1():
    # Asker badmax solution
    for idx in range(0, len(fp)): 
        fp.iloc[idx, 0] = idx

def func2():
    # Alexander Huszagh solution 1
    for idx in range(0, len(fp)):
        fp.to_numpy()[idx, 0] = idx

def func3():
    # user4322543 answer to
    # https://stackoverflow.com/questions/34855859/is-there-a-way-in-pandas-to-use-previous-row-value-in-dataframe-apply-when-previ
    new = []
    for idx in range(0, len(fp)):
        new.append(idx)
    fp[0] = new

def func4():
    # Alexander Huszagh solution 2
    fp[0] = np.arange(146611)

%timeit func1
19.7 ns ± 1.08 ns per loop (mean ± std. dev. of 7 runs, 500000000 loops each)
%timeit func2
19.1 ns ± 0.465 ns per loop (mean ± std. dev. of 7 runs, 500000000 loops each)
%timeit func3
21.1 ns ± 3.26 ns per loop (mean ± std. dev. of 7 runs, 500000000 loops each)
%timeit func4
24.7 ns ± 0.889 ns per loop (mean ± std. dev. of 7 runs, 50000000 loops each)

【讨论】：

由于这是相对较新的.values 应替换为.to_numpy()，建议in the docs。
感谢@AMC，改变了测试结果，现在函数 2 是最快的，而不是函数 1

【解决方案2】：

不要做 iloc/loc/chained-indexing。单独使用 NumPy 接口可将速度提高约 180 倍。如果您进一步删除元素访问，我们可以将其提高到 180,000 倍。

fp = np.empty(shape = (146611, 10))
fp.fill(np.nan)

fp = pd.DataFrame(fp)

# this confirms how slow data access is on my computer
%timeit for idx in range(0, len(fp)): fp.iloc[idx, 0] = idx

1 loops, best of 3: 3min 9s per loop

# this accesses the underlying NumPy array, so you can directly set the data
%timeit for idx in range(0, len(fp)): fp.values[idx, 0] = idx

1 loops, best of 3: 1.19 s per loop

这是因为在 Python 层中有大量代码用于这个有趣的索引，每个循环大约需要 10µs。应该使用 Pandas 索引来检索整个数据子集，然后您可以使用这些子集对整个数据帧进行矢量化操作。单个元素的访问非常缓慢：使用 Python 字典将使您的性能提高 180 倍以上。

当您访问列或行而不是单个元素时，情况会好很多：好 3 个数量级。

# set all items in 1 go.
%timeit fp[0] = np.arange(146611)
1000 loops, best of 3: 814 µs per loop

道德

不要尝试通过链式索引、loc 或 iloc 访问单个元素。从 Python 列表（如果性能绝对关键，则使用 C 接口）在单个分配中生成 NumPy 数组，然后对整个列或数据帧执行操作。

使用 NumPy 数组并直接对列而不是单个元素执行操作，我们的性能提高了 180,000 多倍。不会太破旧。

编辑

@kushy 的评论表明 Pandas 在某些情况下可能有 optimized 索引，因为我最初写了这个答案。始终分析您自己的代码，您的里程可能会有所不同。

【讨论】：

截至 2018 年 8 月，我不得不说 iloc 设置值比通过值访问要快得多。在 for 循环中有一个表达式，基本上是 df[x][y] += 1。一次使用直接访问，即df[specifier_name][y]+=1，一次使用值，即df.values[y, x]+=1，一次使用iloc，即df.iloc[y, x]+=1，速度方面，它是iloc>直接访问>>>值。我不知道为什么。
编辑：显然也取决于其他因素。制作了一个用于测试的小脚本，令我惊讶的是， iloc 比值慢。如果有人感兴趣，我可以提供我最初遇到的问题的概要。
@kushy 这可能已经过优化，不再适用于所有情况，这非常好。我会在我的回答中添加一个免责声明，其中包含指向您的评论的链接。