我发现 sclarke81 和 Sam Robert 的答案都不起作用,我怀疑预分配的概念是否适用于 matfile。下面报告的结果是在 i7-3770 CPU @ 3.4 GHz 上获得的,主内存为 16.8 GB,在 Linux 3.16 上运行 Matlab R2013a。
代码
mf = matfile(fn, 'Writable', true);
mf.x(5000, 200000) = 0;
clear mf
理论上在磁盘上“分配”了 8 GB 内存,初始化为 0。但是,生成的文件大小为 4726 字节,处理时间不到 0.01 秒。我可以将大小增加 10 倍或 100 倍,并且没有太大变化。奇怪的。顺便说一句,末尾的clear 是为了确保文件由Matlab 写入和关闭。
通常我们希望将初始化预分配给 NaN 而不是 0。这样做是 received 方式
mf = matfile(fn, 'Writable', true);
mf.x = nan(5000, 200000);
clear mf
需要 11 秒,生成一个 57 MB 的文件。但正如 OP 指出的那样,这种方法没有意义,因为它首先在内存中生成 8 GB 的整个矩阵,然后将其写出,这违背了matfile 的目的。如果矩阵适合内存,则首先没有理由在处理数据时将数据保存在文件中。
Sam Roberts 建议先如上分配/初始化为 0,然后将值改为 NaN:
mf = matfile(fn, 'Writable', true);
mf.x(5000, 200000) = 0;
mf.x = mf.x * nan;
clear mf
这需要 16 秒,生成的文件大小相同。然而,这并不比上面的简单方法更好,因为在第三行,整个矩阵被读入内存,乘以内存中的标量 NaN,然后再次写出,导致 8 GB 的峰值内存消耗。 (这不仅与documentation 中解释的matfile-variables 的语义一致,而且我还用内存使用监视器进行了检查。)
sclarke81 建议以这种方式避免在内存中生成矩阵:
mf = matfile(fn, 'Writable', true);
mf.x(1 : 5000, 1 : 200000) = nan;
clear mf
这个想法可能是在内存中只生成一个标量 NaN,然后复制到磁盘矩阵的每个元素中。然而,事实并非如此。事实上,这种方法在峰值时似乎消耗了大约 8.38 GB 的内存,比单纯的方法多 12%!
现在更多关于matfile 预分配的优点。如果没有预分配,而是用 NaN 逐行填充数组
mf = matfile(fn, 'Writable', true);
for i = 1 : 5000
mf.x(i, 1 : 200000) = nan(1, 200000);
end
clear mf
这需要 27 秒。 但是,如果一个预分配初始化为 0,然后由 NaN 逐行覆盖
mf = matfile(fn, 'Writable', true);
mf.x(5000, 200000) = 0;
for i = 1 : 5000
mf.x(i, 1 : 200000) = nan(1, 200000);
end
clear mf
这需要很长时间:当我在 45 分钟后中止它时,这个过程只完成了大约 3%,推断为总运行时间的大约 一天!
matlab.io.MatFile 的行为是黑暗而神秘的,目前看来,只有广泛测试才能有效地使用此工具。然而,当涉及到matfile 时,人们可能会得出这样的结论:预分配是一个坏主意。