【问题标题】:Estimating Redshift Table Size估计 Redshift 表大小
【发布时间】:2017-04-02 21:09:23
【问题描述】:

我正在尝试估计 Redshift 中的表将使用多少空间,但是,我发现的唯一资源是计算最小表大小:

https://aws.amazon.com/premiumsupport/knowledge-center/redshift-cluster-storage-space/

这个估计的目的是我需要计算具有以下维度的表将占用多少空间而不会耗尽 Redshift 上的空间(即它将定义我们最终使用多少个节点)

行数:~5000 亿(确切的行数已知) 列数:15(数据类型已知)

我们将不胜感激任何有关估算此大小的帮助。

谢谢!

【问题讨论】:

  • 您参考的文章非常好。你觉得它有什么不足?

标签: amazon-redshift


【解决方案1】:

您引用的文章 (Why does a table in my Amazon Redshift cluster consume more disk storage space than expected?) 很好地解释了存储空间的使用方式。

预测存储的主要困难是预测压缩效率。根据您的数据,Amazon Redshift 将选择合适的Compression Encoding,这将减少您的数据所需的存储空间。

压缩还通过使用 区域地图 大大提高了 Amazon Redshift 查询的速度,该地图可识别存储在每个 1MB 块中的最小值和最大值。高度压缩的数据将存储在更少的块上,从而在查询执行期间需要从磁盘读取的块更少。

估算存储空间的最佳方法是加载数据子集(例如 10 亿行),让 Redshift 自动选择压缩类型,然后外推 strong> 到您的完整数据大小。

【讨论】:

  • 感谢您的回复!我最初是沿着这条路走的,但想看看是否有更快的计算方法。
猜你喜欢
  • 1970-01-01
  • 1970-01-01
  • 2017-04-19
  • 2020-09-27
  • 2010-12-17
  • 1970-01-01
  • 1970-01-01
  • 2022-01-20
  • 2013-08-21
相关资源
最近更新 更多