【问题标题】:Can't start new thread无法启动新线程
【发布时间】:2013-04-30 21:41:12
【问题描述】:

我正在使用多个线程并行处理目录中的所有文件。一切正常,除了线程似乎保持活动状态,因此进程的线程数会上升,直到达到 1K 左右的线程,然后抛出 thread.error can't start new thread 错误。我知道这个错误是由操作系统级别的线程数限制引起的。 我似乎无法弄清楚使线程保持活动状态的错误在哪里。任何的想法?这是我的代码的最小版本。

class Worker(Thread):
    def __init__(self, tasks):
        Thread.__init__(self)
        self.tasks = tasks
        self.daemon = True
        self.start()

def run(self):
    while True:
        func, args, kargs = self.tasks.get()
        try:
            func(*args, **kargs)
        except Exception, e: print e
        self.tasks.task_done()


class ThreadPool:
    def __init__(self, num_threads):
        self.tasks = Queue(num_threads)
        for _ in range(num_threads): Worker(self.tasks)

    def add_task(self, func, *args, **kargs):
        self.tasks.put((func, args, kargs))

    def wait_completion(self):
        self.tasks.join()


def foo(filename)
    pool = ThreadPool(32)
    iterable_data = process_file(filename)

    for data in iterable_data:
        pool.add_task(some_function, data)
    pool.wait_completion()

files = os.listdir(directory)
for file in files:
    foo(file)

【问题讨论】:

    标签: python multithreading threadpool


    【解决方案1】:

    您正在为每个文件启动一个具有 32 个线程的新 ThreadPool。如果您有大量文件,那将是很多线程。而且由于在 CPython 中一次只有 一个 线程可以执行 Python 字节码(由于 Global Interpreter Lock),它不一定很快。

    将 ThreadPool 的创建移到 foo() 函数之外。

    【讨论】:

    • 如果你不需要多进程(线程对 i/o 绑定代码有好处),你也不需要创建自己的线程池:from multiprocessing.pool import ThreadPool。不过,将池移到 foo() 函数之外可以解决问题。
    • 我使用线程是因为任务涉及网络调用 (HTTP)。在这里使用 multiprocessing 对我没有多大帮助。
    • @bj0 将池移到 foo() 之外有效。将其发布为答案,以便我接受。谢谢!
    • @sazpaz 我没有发布它作为答案,因为 Roland 在他的文章中提到了它,他只是有很多额外的信息,现在看来他已经被删除了。
    猜你喜欢
    • 2021-01-13
    • 2016-01-23
    • 1970-01-01
    • 2018-10-17
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多