【发布时间】:2021-07-08 12:01:34
【问题描述】:
我对 Spotfire 上的 BigQuery 连接器感到非常困惑。它正在服用!非常!很长时间在内存中导入我的数据集。
我的配置:AWS windows 实例上的 spotfire (8vCPU - 32Go RAM)。在 BigQuery 上数据集 50Go >100M 行。
是的 - 我应该对如此大的数据集使用数据库内并将查询推送到 BigQuery 并仅使用 Spotfire 进行显示,但这不是我今天的问题????
今天我试图了解导入的工作原理以及为什么需要这么长时间。此导入作业在 21 小时前开始,但仍未完成。服务器的资源几乎没有被使用(CPU、磁盘、网络)。
测试完成:
- 我尝试从 Redshift 导入数据,速度更快(22Go 需要 14 分钟)
- 我检查了导入期间使用的资源:网络速度(Redshift ~ 370Mbs,BQ ~ 8Mbs for 30min),CPU(Redshift ~ 25%,BQ
我真的不明白 Spotfire 在内存中从 BQ 导入数据集时实际上在做什么。似乎没有使用服务器资源,除了运行时间之外没有任何状态指示。
任何 Spotfire 专家对正在发生的事情有任何见解吗? BigQuery 的连接器是否实际上不用于内存分析 - 实际的实施限制因素是什么?
谢谢! ????
【问题讨论】: