【问题标题】:numpy tofile() with very large arrays saves all zeros具有非常大数组的 numpy tofile() 保存所有零
【发布时间】:2013-07-23 15:58:57
【问题描述】:

当我尝试保存一个非常大的(20000 x 20000 元素)数组时,我得到了全零:

In [2]: shape = (2e4,)*2

In [3]: r = np.random.randint(0, 10, shape)

In [4]: r.tofile('r.data')

In [5]: ls -lh r.data
-rw-r--r--  1 whg  staff   3.0G 23 Jul 16:18 r.data

In [6]: r[:6,:6]
Out[6]:
array([[6, 9, 8, 7, 4, 4],
       [5, 9, 5, 0, 9, 4],
       [6, 0, 9, 5, 7, 6],
       [4, 0, 8, 8, 4, 7],
       [8, 3, 3, 8, 7, 9],
       [5, 6, 1, 3, 1, 4]])

In [7]: r = np.fromfile('r.data', dtype=np.int64)

In [8]: r = r.reshape(shape)

In [9]: r[:6,:6]
Out[9]:
array([[0, 0, 0, 0, 0, 0],
       [0, 0, 0, 0, 0, 0],
       [0, 0, 0, 0, 0, 0],
       [0, 0, 0, 0, 0, 0],
       [0, 0, 0, 0, 0, 0],
       [0, 0, 0, 0, 0, 0]])

np.save() 做了类似的奇怪事情。

网上搜了一下,发现OSX有一个已知的bug:

https://github.com/numpy/numpy/issues/2806

当我尝试使用 Python 的 read() 从文件中读取 tostring() 数据时,出现内存错误。

有没有更好的方法来做到这一点?谁能推荐一个实用的解决方法来解决这个问题?

【问题讨论】:

    标签: python file-io numpy out-of-memory


    【解决方案1】:

    使用mmap 对文件进行内存映射,并使用np.frombuffer 创建一个指向缓冲区的数组。在 x86_64 Linux 上测试:

    # `r.data` created as in the question
    >>> import mmap
    >>> with open('r.data') as f:
    ...   m = mmap.mmap(f.fileno(), 0, mmap.MAP_SHARED, mmap.PROT_READ)
    ... 
    >>> r = np.frombuffer(m, dtype='int64')
    >>> r = r.reshape(shape)
    >>> r[:6, :6]
    array([[7, 5, 9, 5, 3, 5],
           [2, 7, 2, 6, 7, 0],
           [9, 4, 8, 2, 5, 0],
           [7, 2, 4, 6, 6, 7],
           [2, 9, 2, 2, 2, 6],
           [5, 2, 2, 6, 1, 5]])
    

    请注意,这里的r 是内存映射数据的视图,这使得它更节省内存,但具有自动获取文件内容更改的副作用。如果您希望它像np.fromfile 返回的数组那样指向数据的私有副本,请添加r = np.copy(r)

    (另外,正如所写,这不会在 Windows 下运行,这需要稍微不同的 mmap 标志。)

    【讨论】:

      猜你喜欢
      • 2019-02-17
      • 2021-12-29
      • 2020-12-31
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 2018-06-23
      相关资源
      最近更新 更多