【问题标题】:Google BigQuery is running queries slowlyGoogle BigQuery 运行查询缓慢
【发布时间】:2012-11-24 05:15:24
【问题描述】:

我正在对大约 84GB 日志数据的数据集运行一个简单的 bigQuery。

查询大约需要 110 秒才能完成。对于这种大小的数据集,这是否正常?

【问题讨论】:

    标签: performance google-bigquery large-data-volumes


    【解决方案1】:

    经过进一步调查,您的桌子看起来很碎片化。我们通常会运行一个合并进程来防止这种情况,但在我们验证错误修复时它已经关闭了几个星期。我已经重新启动了聚结器并在你的桌子上运行它。如果您仍然看到性能不佳,请告诉我。

    作为一种最佳做法,您最好不要频繁地以较大的块导入数据,或者将数据拆分到基于时间的表中。 BigQuery 并不是真正设计用于处理对同一个表的大量小型导入。

    【讨论】:

    • Project id: 326440123436 查询很简单:SELECT timestamp FROM [streaklogsdataset.log_faaf98_00000001353024000000_00000001355616000000] order by timestamp desc LIMIT 1;
    • 约旦 - 调查这个问题运气好吗?
    • 抱歉,这是一个人为的查询示例。这是一个更现实的:SELECT errorType, errorTrace, uid, timestamp FROM [streaklogsdataset.log_faaf98_00000001353024000000_00000001355616000000] where httpStatus >= 500 order by uid asc, timestamp desc limit 500;
    • 好的,我刚刚看了你的桌子。它位于 18k 片段中。我们的压缩表的聚结器已经暂停了几个星期,最近才重新启动。建议:运行表复制作业将其复制到新表并使用它,或者导出到 json 并重新导入。 (我们正在重新启动聚结器,但可能需要 24 小时左右才能赶上)。
    • OK 你的桌子已经修好了。如果您仍然发现该表存在性能问题,请告诉我。
    猜你喜欢
    • 1970-01-01
    • 2021-11-04
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2023-03-13
    相关资源
    最近更新 更多