【发布时间】:2015-11-07 07:10:49
【问题描述】:
我正在尝试运行 Amazon EMR Hadoop 进程,该进程将处理 S3 存储桶中的 CloudFront 日志。由于 CloudFront 在同一个存储桶中生成大量日志,如何过滤日志文件而不为 S3 访问产生额外带宽?
【问题讨论】:
-
提供有关您要过滤的位置的更多信息。您使用亚马逊下载日志文件的频率如何?您或许可以使用 CloudFront 上的 API 来过滤日志文件。
-
某种每天运行的 EMR 流程。我想检索当天的所有日志并将它们用作 EMR 的输入。您想向我展示如何使用 CloudFront API 作为 EMR Hadoop 的输入吗?
标签: amazon-web-services amazon-emr