【发布时间】:2022-12-18 18:46:03
【问题描述】:
好的,所以,我有自动加载器在 directory listing mode 中工作,因为 event driven mode 需要我们无法在 LIVE 中获得的更高权限。
所以,基本上自动加载器所做的是:从着陆区(许多小文件)迭代地从许多不同的文件夹中读取镶木地板文件,然后将它们写入原始容器作为 delta lake,通过模式推断和演变,创建外部表并进行优化。
就是这样。
我的问题是:对于这个工作负载,我在 Azure 中的集群的理想节点类型(工作者和驱动程序)应该是什么?意思是“计算优化”、“存储优化”还是“内存优化”?
从这个link,我可以看出“计算优化”可能是最好的选择,但我想知道我的工作,大部分工作都是读取登陆文件(许多小文件)并写入增量文件、检查点和模式,所以存储优化不应该在这里最好吗?
我打算尝试所有这些,但如果有人已经有了指示,我将不胜感激。
顺便说一句,这里的存储是 Azure 数据湖 gen 2。
【问题讨论】:
标签: azure databricks azure-databricks databricks-autoloader