【发布时间】:2020-09-22 16:12:13
【问题描述】:
我想列出 Azure Databricks 中每个数据库中的所有表。
所以我希望输出看起来像这样:
Database | Table_name
Database1 | Table_1
Database1 | Table_2
Database1 | Table_3
Database2 | Table_1
etc..
这是我目前拥有的:
from pyspark.sql.types import *
DatabaseDF = spark.sql(f"show databases")
df = spark.sql(f"show Tables FROM {DatabaseDF}")
#df = df.select("databaseName")
#list = [x["databaseName"] for x in df.collect()]
print(DatabaseDF)
display(DatabaseDF)
df = spark.sql(f"show Tables FROM {schemaName}")
df = df.select("TableName")
list = [x["TableName"] for x in df.collect()]
## Iterate through list of schema
for x in list:
### INPUT Required: Change for target table
tempTable = x
df2 = spark.sql(f"SELECT COUNT(*) FROM {schemaName}.{tempTable}").collect()
for x in df2:
rowCount = x[0]
if rowCount == 0:
print(schemaName + "." + tempTable + " has 0 rows")
但我并没有完全得到结果。
【问题讨论】:
-
请提供你现在得到的输出
标签: python azure pyspark databricks azure-databricks