【问题标题】:How to call numpy/scipy C functions from Cython directly, without Python call overhead?如何直接从 Cython 调用 numpy/scipy C 函数,而不需要 Python 调用开销?
【发布时间】:2013-04-08 09:16:03
【问题描述】:

我正在尝试在 Cython 中进行严重依赖于一些 numpy/scipy 数学函数(如 numpy.log)的计算。我注意到如果我在 Cython 中循环调用 numpy/scipy 函数,会产生巨大的间接成本,例如:

import numpy as np
cimport numpy as np
np.import_array()
cimport cython

def myloop(int num_elts):
   cdef double value = 0
   for n in xrange(num_elts):
     # call numpy function
     value = np.log(2)

这是非常昂贵的,大概是因为np.log通过Python而不是直接调用numpy C函数。如果我将该行替换为:

from libc.math cimport log
...
# calling libc function 'log'
value = log(2)

然后它会快得多。但是,当我尝试将 numpy 数组传递给 libc.math.log 时:

cdef np.ndarray[long, ndim=1] foo = np.array([1, 2, 3])
log(foo)

它给出了这个错误:

TypeError: only length-1 arrays can be converted to Python scalars

我的问题是:

  1. 是否可以调用 C 函数并将其传递给 numpy 数组?或者它只能用于标量值,这需要我编写一个循环(例如,如果我想将它应用到上面的 foo 数组。)
  2. 是否有类似的方法可以直接从 C 调用 scipy 函数而无需 Python 开销?如何导入 scipy 的 C 函数库?

具体示例:假设您想在 Cython 的 for 循环内的标量值上调用许多 scipy 或 numpy 的有用统计函数(例如 scipy.stats.*)?在 Cython 中重新实现所有这些函数太疯狂了,因此必须调用它们的 C 版本。例如,所有与 pdf/cdf 相关的函数以及来自各种统计分布的采样(例如,请参阅 http://docs.scipy.org/doc/scipy/reference/generated/scipy.stats.rv_continuous.pdf.html#scipy.stats.rv_continuous.pdfhttp://www.johndcook.com/distributions_scipy.html)如果您在循环中使用 Python 开销调用这些函数,它会非常慢。

谢谢。

【问题讨论】:

  • scipy.statspdf等函数主要用Python实现。您可以通过一次处理多个数字来避免开销。
  • 我刚刚发现这篇文章,因为我有一个非常相似的问题。我已经对我的循环进行了 cythonized 处理,但是循环中有 numpy 和 scipy 调用,所以我没有看到默认 Python 有任何加速。看到重写 numpy 和 scipy 函数是不切实际的,这似乎让 cython 的价值主张没有我最初希望的那么有吸引力。

标签: python optimization numpy scipy cython


【解决方案1】:

不能在numpy数组上应用log等C函数,numpy没有可以从cython调用的C函数库。

Numpy 函数已经经过优化,可以在 numpy 数组上调用。除非您有一个非常独特的用例,否则您不会从将 numpy 函数重新实现为 C 函数中获得太多好处。 (可能 numpy 中的某些功能没有很好地实现,在这种情况下,请考虑将您的导入作为补丁提交。)但是您确实提出了一个很好的观点。

# A
from libc.math cimport log
for i in range(N):
    r[i] = log(foo[i])

# B
r = np.log(foo)

# C
for i in range(n):
    r[i] = np.log(foo[i])

一般来说,A 和 B 应该有相似的运行时间,但 C 应该避免并且会慢很多。

更新

这是 scipy.stats.norm.pdf 的代码,您可以看到它是用 python 编写的,带有 numpy 和 scipy 调用。此代码没有 C 版本,您必须“通过 python”调用它。如果这是阻碍您前进的原因,您需要在 C/Cython 中重新植入它,但首先我会花一些时间非常仔细地分析代码,看看是否有任何较低的悬而未决的果实要先追求。

def pdf(self,x,*args,**kwds):
    loc,scale=map(kwds.get,['loc','scale'])
    args, loc, scale = self._fix_loc_scale(args, loc, scale)
    x,loc,scale = map(asarray,(x,loc,scale))
    args = tuple(map(asarray,args))
    x = asarray((x-loc)*1.0/scale)
    cond0 = self._argcheck(*args) & (scale > 0)
    cond1 = (scale > 0) & (x >= self.a) & (x <= self.b)
    cond = cond0 & cond1
    output = zeros(shape(cond),'d')
    putmask(output,(1-cond0)+np.isnan(x),self.badvalue)
    if any(cond):
        goodargs = argsreduce(cond, *((x,)+args+(scale,)))
        scale, goodargs = goodargs[-1], goodargs[:-1]
        place(output,cond,self._pdf(*goodargs) / scale)
    if output.ndim == 0:
        return output[()]
    return output

【讨论】:

  • 但是,如果我需要在无法向量化的代码中编写一个 for 循环,并且我想在该循环中使用某些 numpy 函数(在标量值上,而不是向量上),该怎么办?我是否必须在 Cython 中重新实现那些 numpy 函数?看起来很傻。我只能使用选项 C 来做到这一点,正如您所指出的,这不是一个好选项
  • 在这种情况下,您最好的选择可能是在 cython 中重新实现这些函数并使用选项 A。如果您不介意我的询问,您需要在循环中调用哪些 numpy 函数.
  • 统计相关的各种功能。我编辑了我的答案以获得更多详细信息。例如,所有与 pdf/cdf 相关的函数以及从各种统计分布中采样(例如,参见 docs.scipy.org/doc/scipy/reference/generated/…johndcook.com/distributions_scipy.html)。使用 libc.math 中的原语重新实现所有这些 pdf 只是为了在 Cython 中得到它似乎是不正确的......必须是更好的方法吗?
  • 你可能可以在 numpy 中访问很多元素方面的 ufunc。
猜你喜欢
  • 2012-07-26
  • 2017-11-26
  • 2015-07-30
  • 2011-01-30
  • 2023-04-07
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 2013-08-05
相关资源
最近更新 更多