【问题标题】:Google Cloud Platform architecture谷歌云平台架构
【发布时间】:2017-08-10 20:36:38
【问题描述】:

一个简单的问题:

通过 Google Big Query 处理的数据是否存储在 Google Cloud Storage 上,并且仅出于 GBQ 目的进行分段?还是 Google Big Query 拥有自己的存储机制。

我正在尝试学习架构,我看到箭头来回指向对方,但它没有说明 GBQ 的架构在哪里?

谢谢。

【问题讨论】:

    标签: google-bigquery google-cloud-platform google-cloud-storage


    【解决方案1】:

    来自Bigquery under the hood

    Colossus - 分布式存储

    BigQuery 依赖于 Google 最新一代分布式 Colossus 文件系统。每个 Google 数据中心都有自己的 Colossus 集群,并且 每个 Colossus 集群都有足够的磁盘来为每个 BigQuery 用户提供 数以千计的专用磁盘一次。巨像也处理 复制、恢复(当磁盘崩溃时)和分布式管理 (所以没有单点故障)。 Colossus 的速度足够快 允许 BigQuery 为许多内存提供类似的性能 数据库,但利用便宜得多但高度并行化, 可扩展、持久且高性能的基础架构。

    BigQuery 利用 ColumnIO 列式存储格式和 压缩算法以最佳方式存储 Colossus 中的数据 读取大量结构化数据的方法。Colossus 允许 BigQuery 用户可以无缝扩展到数十 PB 的存储空间, 无需支付附加更昂贵的计算的代价 资源——大多数传统数据库的典型特征。

    关于 ColumnIO 的部分已过时——BigQuery 现在使用 Capacitor format——但其余部分仍然相关。

    【讨论】:

    • Colossus 是谷歌云存储的东西吗?意思是两者都使用吗?还是 GCS 和 Colossus 之间的独立架构?
    • GCS is built on top of Colossus。 Colossus 为 Google 自己的服务提供了较低级别的存储 API。
    • 谢谢!这就是我需要知道的部分。
    猜你喜欢
    • 2020-06-02
    • 2019-10-31
    • 1970-01-01
    • 1970-01-01
    • 2020-12-11
    • 1970-01-01
    • 2020-08-06
    • 2018-09-26
    • 1970-01-01
    相关资源
    最近更新 更多