【问题标题】:Google BigQuery really slow on small datasetGoogle BigQuery 在小数据集上真的很慢
【发布时间】:2020-07-29 03:14:43
【问题描述】:

正在测试 Google BigQuery 以替换我们过去使用的传统数据库(PostgreSQL / MySQL),但发现性能极其(而且奇怪)缓慢。

上传了约 6mb 的数据集(约 44,000 行)进行测试。

尝试运行一些简单的查询:

SELECT Sub_Category, COUNT(*) AS COUNT FROM rnd-projects-247203.test.data 按子类别分组

谁能帮我解释一下为什么对一个小数据集执行如此简单的查询需要超过 20 秒才能运行?我在设置中做错了什么/需要做一些不同的事情吗?

Execution details screenshot

谢谢!

添加:在 S00 下展开的执行细节

数据是从 Google Drive .csv 文件中获取和加载的

Execution details screenshot - expanded

【问题讨论】:

  • 您能否扩展 S00 步骤,这是几乎所有时间都花在的地方?我怀疑这可能与存储位置和数据输出有关,但这可能有助于我们确认。
  • 正如 Francesco 所说,这种速度没有任何意义 - 除非您可以向我们展示数据是如何加载的。
  • 您能否提供有关数据所在位置以及数据加载方式的更多详细信息?
  • 大家好,感谢您的帮助 - 我添加了新的屏幕截图。数据作为 .csv 文件位于 Google Drive 中,我已通过 Google BigQuery UI 手动添加(即,创建表 > 加载数据 > 从 Google Drive)
  • 一切正常,您可以尝试对任何 bigquery 公共数据集运行查询吗?告诉我执行时间?

标签: google-bigquery


【解决方案1】:

BigQuery 是一个 PB 级数据仓库。它是对传统数据库的最佳补充。不应考虑使用它来代替 MySql/Postgres。

BigQuery 对于大规模查询非常快,例如 3-10 秒对于 TB/PB 规模的查询。对于小型查询,运行时间也在 1-2 秒左右。无论如何,不​​像事务数据库那样需要 20 毫秒。

【讨论】:

    猜你喜欢
    • 2021-07-05
    • 2016-08-01
    • 2023-03-13
    • 1970-01-01
    • 2015-03-07
    • 1970-01-01
    • 1970-01-01
    • 2022-01-14
    • 1970-01-01
    相关资源
    最近更新 更多