【问题标题】:Spotfire and BigQuerySpotfire 和 BigQuery
【发布时间】:2021-07-08 12:01:34
【问题描述】:

我对 Spotfire 上的 BigQuery 连接器感到非常困惑。它正在服用!非常!很长时间在内存中导入我的数据集。

我的配置:AWS windows 实例上的 spotfire (8vCPU - 32Go RAM)。在 BigQuery 上数据集 50Go >100M 行。

是的 - 我应该对如此大的数据集使用数据库内并将查询推送到 BigQuery 并仅使用 Spotfire 进行显示,但这不是我今天的问题????

今天我试图了解导入的工作原理以及为什么需要这么长时间。此导入作业在 21 小时前开始,但仍未完成。服务器的资源几乎没有被使用(CPU、磁盘、网络)。

测试完成:

  • 我尝试从 Redshift 导入数据,速度更快(22Go 需要 14 分钟)
  • 我检查了导入期间使用的资源:网络速度(Redshift ~ 370Mbs,BQ ~ 8Mbs for 30min),CPU(Redshift ~ 25%,BQ

我真的不明白 Spotfire 在内存中从 BQ 导入数据集时实际上在做什么。似乎没有使用服务器资源,除了运行时间之外没有任何状态指示。

任何 Spotfire 专家对正在发生的事情有任何见解吗? BigQuery 的连接器是否实际上不用于内存分析 - 实际的实施限制因素是什么?

谢谢! ????

【问题讨论】:

    标签: google-bigquery spotfire


    【解决方案1】:

    我们遇到了以下 Spotfire 版本中修复的问题:

    TS 10.10.3 LTS HF-014 TS 11.2.0 HF-002

    还请对从 BigQuery 提取数据时使用 Storage API 的想法进行投票和评论:

    https://ideas.tibco.com/ideas/TS-I-7890

    谢谢,

    托马斯·布隆伯格 TIBCO Spotfire 高级产品经理

    【讨论】:

    • 感谢 Thomas 的快速回答? - 上面的结果是 TS11.2.0.59。所以我不确定我运行的是正确的版本(AWS 最新的每小时版本)。此外,与存储 API 相关 - 对于这个用例来说,这确实是一个很棒的功能。我正在考虑导出 BQ > CSV GCS > local > import 但这对于工业化来说非常麻烦。您能否确认我运行的版本已解决您提到的问题:TS11.2.0.59(Windows 服务器)。谢谢!
    【解决方案2】:

    @Tarik,您需要在最后安装上述修补程序。

    您可以从以下链接下载最新的修补程序:https://community.tibco.com/wiki/list-hotfixes-tibco-spotfire-clients-analyst-web-player-consumerbusiness-author-and-automation

    【讨论】:

    • 谢谢@manoj 我会测试一下。我使用的是#AWS instance hourly license,但我不太明白如何登录门户下载补丁……我开了一张 TIBCO 支持的票。
    【解决方案3】:

    更多测试后的更新。感谢@Thomas 和@Manoj 非常有帮助的支持。结果如下:

    1. 我将 spotfire 版本更新为 11.2.0 HF002,它解决了使用 BigQuery 将数据放入内存的问题 ? - 使用(数据 > 添加数据...),数据吞吐量非常好虽然低 ~ 13 分钟/Go。网络吞吐量达到了 8Mbs。
    2. 按照 Thomas 在 tibco ideas 中的建议,我安装了 Simba JDBC driver,并且使用 (Data > Information Designer) 数据吞吐量显着提高到了 ~ 50s/Go。当然,问题是您需要访问服务器才能安装它。网络吞吐量大约为 200Mbs。我不确定什么是限制因素(Spotfire 配置、Samba 驱动程序或 BigQuery)。
    3. 使用 Redshift 连接器连接到具有相同数据的 Redshift 集群并使用 (Data > Information Designer) 进行连接,我的数据导入吞吐量约为 30s/Go网络吞吐量为 380Mbs。

    因此,我的建议是在连接到 BigQuery (10-30Go) 中的中等大小数据集时,使用最新的 simba 驱动程序和 Information Designer 以获得最佳的“内存中”数据导入吞吐量。这导致 1 分钟/Go 的数据导入吞吐量。

    目前尚不清楚是什么让 Redshift 连接更快,以及是否有更快的方法将数据从 GCP/BigQuery 导入到 Spotfire ?‍♂️

    欢迎任何cmets或建议! 塔里克

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 2016-12-10
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      相关资源
      最近更新 更多