【问题标题】:What kind of Nodes to choose for Autoloader- Azure为 Autoloader 选择什么样的节点 - Azure
【发布时间】:2022-12-18 18:46:03
【问题描述】:

好的,所以,我有自动加载器在 directory listing mode 中工作,因为 event driven mode 需要我们无法在 LIVE 中获得的更高权限。

所以,基本上自动加载器所做的是:从着陆区(许多小文件)迭代地从许多不同的文件夹中读取镶木地板文件,然后将它们写入原始容器作为 delta lake,通过模式推断和演变,创建外部表并进行优化。

就是这样。

我的问题是:对于这个工作负载,我在 Azure 中的集群的理想节点类型(工作者和驱动程序)应该是什么?意思是“计算优化”、“存储优化”还是“内存优化”?

从这个link,我可以看出“计算优化”可能是最好的选择,但我想知道我的工作,大部分工作都是读取登陆文件(许多小文件)并写入增量文件、检查点和模式,所以存储优化不应该在这里最好吗?

我打算尝试所有这些,但如果有人已经有了指示,我将不胜感激。

顺便说一句,这里的存储是 Azure 数据湖 gen 2。

【问题讨论】:

    标签: azure databricks azure-databricks databricks-autoloader


    【解决方案1】:

    如果你不做太多复杂的聚合,那么我会建议为这项工作进入“计算优化”或“通用”节点 - 主要负载无论如何都是从文件中读取数据,将它们组合在一起然后写入 ADLS,所以这里的 CPU 能力越强,数据处理速度越快。

    只有当您有太多小文件(考虑数万/数十万)时,您才可以考虑为驱动程序考虑更大的节点,其作用是识别存储中的新文件。

    【讨论】:

      猜你喜欢
      • 2013-07-22
      • 2017-07-12
      • 1970-01-01
      • 2011-09-17
      • 1970-01-01
      • 1970-01-01
      • 2016-08-18
      • 2019-03-16
      • 1970-01-01
      相关资源
      最近更新 更多