【问题标题】:multiprocessing: using pool inside imported function多处理:在导入函数中使用池
【发布时间】:2014-02-14 11:22:26
【问题描述】:

我正在尝试创建一个脚本,它从一个单独的模块中调用一个函数来进行并行处理。

我的“顶级”脚本如下所示:

from hydrology import model, descriptors
if __name__ == "__main__":
   datafile = r"C:\folder\datafile.shp"
   myModel = model.Model(data = datafile)

   res = descriptors.watershed_pll(myModel)

descriptors 模块如下所示:

from multiprocessing import Pool
from arcfunc import multi_watershed

def watershed_pll(model):
    pool = Pool()
    for key, val in model.stations.iteritems():
        res = pool.apply_async(multi_watershed(val, key))
    pool.close()
    pool.join()
    return res

如您所见,并行运行的函数是从模块arcfunc导入的, 执行并行化的函数在模块descriptors 内,运行所有内容的脚本再次分开。

我跑的时候没有异常,但是我有两个问题:

  1. res.successful() 返回 False
  2. 它的运行速度并不比不使用多处理快。

我怀疑我的架构使事情变得复杂,但是并行化功能位于单独的模块中很重要。

有什么建议吗?

【问题讨论】:

    标签: python performance python-2.7 multiprocessing pool


    【解决方案1】:

    代码没有将函数和参数传递给apply_async,而是直接(在主进程中)调用multi_watershed,并传递函数的返回值。

    传递函数和参数。

    替换以下行:

    res = pool.apply_async(multi_watershed(val, key))
    

    与:

    res = pool.apply_async(multi_watershed, (val, key))
    

    【讨论】:

    • 呃!谢谢。好吧,它可以工作,但我仍然有一个问题是它没有更快。这可能与正在使用的外部库有关:arcpy....
    • @jramm,对不起,我不知道 arcpy。
    猜你喜欢
    • 2012-02-20
    • 2018-02-26
    • 1970-01-01
    • 2023-04-04
    • 2021-07-19
    • 2021-05-14
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多