【发布时间】:2016-08-05 22:27:00
【问题描述】:
我对数据仓库设计还很陌生,并且正在努力研究如何设计给定非常相似但又有些不同的指标的事实表。假设您正在评估以下指标,您将如何分解事实表(在这种情况下,公司是客户的一个子集)。您是否可以使用一个表来完成所有这些操作,或者每个被测量的指标都需要自己的事实表,或者被测量的指标的每个部分都是一个事实表中的自己的列?
- 公司每天/每月/每年处理的文件总数
- 公司每天/每月/每年处理的总文件大小
- 公司每天/每月/每年的总错误文件数
- 公司每天/每月/每年有 # 个文件失败
- 客户每天/每月/每年处理的文件总数
- 每天/每月/每年处理的总客户文件大小
- 客户每天/每月/每年错误的文件总数
- 每天/每月/每年的客户总数 # 个文件失败
【问题讨论】:
-
我认为您应该重新表述您的问题并添加一些细节。你用的是什么数据库?你的输入数据是什么样的?对我来说,这些通常是创建事实表的原始事实。从那里你可以做各种有趣的事情。但我们需要了解更多。
-
这最终会在 Redshift 中。数据输入将以服务提供的 JSON 形式出现。我目前正在研究概念数据模型。我假设所有这些相似的指标都将成为一个事实表的一部分,在它自己的列中。
-
另外,如果总数需要是日、周和月的组合,该怎么办。这个事实表将如何设计来合并总数?
-
没有。数据仓库就是要理解业务流程。在设计事实时不要被技术所束缚。根据您的描述,这可以通过一个事实表来满足,然后任何数量的报告/BI 工具都会处理正确的汇总,例如:Excel 数据透视表。你真的应该玩一下 Excel 数据透视表,然后你就会明白这些东西是如何自动卷起的。
标签: data-warehouse