【发布时间】:2020-03-31 13:16:42
【问题描述】:
我是一个大型 Scala 项目的新开发人员,所有代码都存储为笔记本并在 Databricks 集群中运行...
每个笔记本都定义了类和方法,我们有“主”笔记本,它们的代码行数很少,但在 %run ./myPackage/Foo 等单元格中执行所有需要的 Scala 笔记本(即该项目中的几乎所有笔记本)。然后这些“主要”笔记本有一个小的 Scala 代码单元,如下所示:
import com.bar.foo.Main
Main.main()
此外,每个笔记本都会导入它需要的包,如 Scala 指令import com.bar.foo.MyClass。
我觉得这真的很烦人:
- 如果我移动一个笔记本,我必须更新所有主笔记本/测试笔记本中的所有
%run path/Notebook命令 - 我觉得在主笔记本中运行笔记本
并在所有其他笔记本中导入包是多余的。
您知道另一个工作流程吗?有没有更简单的方法来处理 Databricks 中的多个 Scala 笔记本?
【问题讨论】:
-
在我工作的地方,我们通过将笔记本按它们所做的事情分组到另一个笔记本(想象一个包)中来避免这种情况,该笔记本会调用所有其他笔记本,然后在需要时我们称之为“包”笔记本。这样,如果您更改了一个笔记本的位置,您只能在调用它的笔记本上更改它。
标签: scala databricks