【问题标题】:Why does importing module in '__main__' not allow multiprocessig to use module?为什么在 '__main__' 中导入模块不允许 multiprocessig 使用模块?
【发布时间】:2017-04-21 23:01:17
【问题描述】:

我已经通过将导入移至顶部声明解决了我的问题,但这让我想知道:为什么我不能在作为 multiprocessing 目标的函数中使用在 '__main__' 中导入的模块?

例如:

import os
import multiprocessing as mp

def run(in_file, out_dir, out_q):
    arcpy.RaterToPolygon_conversion(in_file, out_dir, "NO_SIMPIFY", "Value")
    status = str("Done with "+os.path.basename(in_file))
    out_q.put(status, block=False)

if __name__ == '__main__':
    raw_input("Program may hang, press Enter to import ArcPy...")
    import arcpy

    q = mp.Queue()
    _file = path/to/file
    _dir = path/to/dir
    # There are actually lots of files in a loop to build
    # processes but I just do one for context here
    p = mp.Process(target=run, args=(_file, _dir, q))
    p.start()

# I do stuff with Queue below to status user

当您在 IDLE 中运行它时,它根本不会出错...只是继续进行Queue 检查(这很好,所以不是问题)。问题是,当您在 CMD 终端(操作系统或 Python)中运行它时,会产生 arcpy 未定义的错误!

只是一个奇怪的话题。

【问题讨论】:

  • 你是在linux还是windows上运行?
  • @tdelaney Windows,这就是我使用if __name__ 语句的原因。
  • 在 WIndows 上,multiprocessing 实际上是 imports 主脚本到它产生的每个 Python 子进程中,因此在这些情况下 if __name__ == '__main__' 将是 False。在您的脚本中,这意味着在执行 run() 时不会导入模块 arcpy,因为它所在的进程在完全独立的内存空间中执行。

标签: python python-2.7 multiprocessing arcpy


【解决方案1】:

在类 unix 系统和 Windows 中情况有所不同。在 unixy 系统上,multiprocessing 使用fork 创建共享父内存空间的写时复制视图的子进程。孩子会看到来自父母的导入,包括父母在if __name__ == "__main__": 下导入的任何内容。

在 windows 上,没有 fork,必须执行一个新进程。但是简单地重新运行父进程是行不通的——它会再次运行整个程序。相反,multiprocessing 运行自己的 python 程序,该程序导入父主脚本,然后腌制/取消腌制父对象空间的视图,希望这对于子进程来说足够了。

该程序是子进程的__main__,而父脚本的__main__ 没有运行。主脚本就像任何其他模块一样被导入。原因很简单:运行父 __main__ 只会再次运行完整的父程序,mp 必须避免。

这是一个测试来显示发生了什么。一个名为 testmp.py 的主模块和一个由第一个模块导入的第二个模块 test2.py。

testmp.py

import os
import multiprocessing as mp

print("importing test2")
import test2

def worker():
    print('worker pid: {}, module name: {}, file name: {}'.format(os.getpid(), 
        __name__, __file__))

if __name__ == "__main__":
    print('main pid: {}, module name: {}, file name: {}'.format(os.getpid(), 
        __name__, __file__))
    print("running process")
    proc = mp.Process(target=worker)
    proc.start()
    proc.join()

test2.py

import os

print('test2 pid: {}, module name: {}, file name: {}'.format(os.getpid(),
        __name__, __file__))

在 Linux 上运行时,test2 被导入一次,worker 运行在主模块中。

importing test2
test2 pid: 17840, module name: test2, file name: /media/td/USB20FD/tmp/test2.py
main pid: 17840, module name: __main__, file name: testmp.py
running process
worker pid: 17841, module name: __main__, file name: testmp.py

在 windows 下,请注意“importing test2”打印了两次 - testmp.py 运行了两次。但是“main pid”只打印了一次——它的__main__ 没有运行。那是因为multiprocessing在导入过程中将模块名称改为__mp_main__。

E:\tmp>py testmp.py
importing test2
test2 pid: 7536, module name: test2, file name: E:\tmp\test2.py
main pid: 7536, module name: __main__, file name: testmp.py
running process
importing test2
test2 pid: 7544, module name: test2, file name: E:\tmp\test2.py
worker pid: 7544, module name: __mp_main__, file name: E:\tmp\testmp.py

【讨论】:

  • 我的mp.Process() 不会每次都重新运行__main__ 是吗?我只希望每个子进程运行def run()中的代码。
  • 不,但它正在重新导入您的主模块并调用它__mp_main__。这就是为什么您将不想在if __name__ == "__main__": 下重新运行的内容隐藏起来。我已经用演示更新了答案。
  • 子启动在 Windows 中的成本要高得多 - 执行一个新的 python 副本并导入模块。
  • 尽早启动长期存在的子流程并让它们长期存在。可能是 Pool 并在运行工作项时使用 apply。父进程不需要的模块可以导入工作进程本身。将大型数据集从父级传递给子级也很昂贵……如果可能,让子级从磁盘读取原始文件。
  • 另外,编写一个完全独立的子进程与某种 RPC 通信。也许是 python 的 xml-rpc 或(我更喜欢)zeromq。再一次,保持父母和孩子之间的有效载荷确实有帮助。
猜你喜欢
  • 2017-10-27
  • 1970-01-01
  • 2012-08-31
  • 1970-01-01
  • 2012-03-07
  • 1970-01-01
  • 1970-01-01
  • 2012-10-22
相关资源
最近更新 更多