【发布时间】:2018-12-18 14:54:49
【问题描述】:
我将生成一个包含大约 7*10^11 个整数的数据集。每个整数将在 0-1000 之间。未压缩,这将需要大约 14 TB(短整数)的存储空间。
对于此类信息,是否有内置压缩的高效数据库解决方案?最好用二进制存储?
编辑:记录必须按顺序存储。
【问题讨论】:
-
将这些数据放入数据库后需要做什么?即:您是否需要良好的随机读取性能/良好的切片访问/最佳写入性能,但不一定需要读取性能?
-
还有一个数量级的数字,7e10 短裤是 1.4TB 而不是 14TB
-
值是均匀分布在 0 还是 1000 之间,还是某些数字更有可能出现?一个数字是否可能取决于先前的数字?