【发布时间】:2014-01-30 21:20:43
【问题描述】:
我有一个 Web 应用程序需要发送有关其使用情况的报告,我想为此目的使用 Amazon RedShift 作为数据仓库, 我应该如何收集数据?
每次用户与我的应用程序交互时,我都想报告.. 那么我应该什么时候将文件写入 S3 呢?有多少? 我的意思是: - 如果不立即发送信息,那么我可能会因为连接丢失而丢失它,或者在收集信息并准备发送到 S3 时系统中的一些错误... - 如果我确实在每次用户交互时将文件写入 S3,我最终会得到数百个文件(每个文件上的数据最少),需要在复制到 RedShift 后对其进行管理、排序、删除......这似乎不是就像一个很好的解决方案。
我错过了什么?我应该改用 DynamoDB,我应该改用简单的插入 Redshift 吗?
如果我确实需要将数据写入 DynamoDB,是否应该在复制后删除保留表.. 最佳实践是什么?
无论如何,在 RedShift 中避免数据重复的最佳做法是什么?
感谢您的帮助!
【问题讨论】:
标签: amazon-web-services amazon-s3 amazon-ec2 amazon-dynamodb amazon-redshift