【问题标题】:Flink with Ceph as the persistent storageFlink 使用 Ceph 作为持久存储
【发布时间】:2017-12-05 11:03:07
【问题描述】:

Flink 文档表明 Ceph 可以用作状态的持久存储。 https://ci.apache.org/projects/flink/flink-docs-release-1.3/dev/stream/checkpointing.html

考虑到 Ceph 是一个事务型数据库,会不会对 Flink 的性能造成不利影响?

【问题讨论】:

    标签: apache-flink ceph


    【解决方案1】:

    Ceph 将自己描述为“统一的分布式存储系统”,并提供网络文件系统 API。因此,它应该与 Flink 的状态后端无缝协作,将检查点持久化到远程文件系统。

    我不知道有人在使用 Ceph(HDFS 和 S3 更常用)并且没有关于性能的信息。但是请注意,Flink 可以异步写入检查点,这样存储系统的性能不会影响 Flink 应用程序的处理速度。但是,它可能会限制进行检查点的时间间隔。

    更新: (2018 年 2 月)我注意到多个用户在 Flink 的用户邮件列表中报告他们正在使用 Ceph 和 Flink。

    更新 2: Flink 在 S3 协议上运行良好,并且 (Presto & Hadoop) Flink 的 S3 FileSystem 插件都可以正常运行。

    【讨论】:

    • 是否有任何将 CEPH 配置为 Apache Flink 检查点的指南?正如我从链接中看到的 - 我应该将 ceph dir 挂载到 Apache Flink 的每个节点并作为 file:// 工作是正确的方式吗?
    • 它似乎也通过 S3 协议工作。您应该配置:s3://testflink/bootstrapjob,其中 testflink 是 Ceph 中的存储桶。要进行身份验证,我们应该通过:s3.access-key、s3.secrect-key。 s3.endpoint 应该配置到你的 Ceph 端点,否则默认情况下 Flink 会指向 aws。
    猜你喜欢
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2011-03-21
    • 1970-01-01
    • 2021-02-23
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多