【发布时间】:2022-11-10 03:34:10
【问题描述】:
我有 3 个数据框df1(EMPLOYEE_INFO),df2(DEPARTMENT_INFO),df3(COMPANY_INFO),我想通过加入所有三个数据框来更新 df1 中的列。列的名称是 df1 中的 FLAG_DEPARTMENT。我需要设置 FLAG_DEPARTMENT='POLITICS' 。在 sql 查询中将如下所示。
UPDATE [COMPANY_INFO] INNER JOIN ([DEPARTMENT_INFO]
INNER JOIN [EMPLOYEE_INFO] ON [DEPARTMENT_INFO].DEPT_ID = [EMPLOYEE_INFO].DEPT_ID)
ON [COMPANY_INFO].[COMPANY_DEPT_ID] = [DEPARTMENT_INFO].[DEP_COMPANYID]
SET EMPLOYEE_INFO.FLAG_DEPARTMENT = "POLITICS";
如果这三个表的列中的值匹配,我需要在我的employee_Info 表中设置我的 FLAG_DEPARTMENT='POLITICS'
我怎样才能在 pyspark 中实现同样的目标。我刚开始学习pyspark没有那么深入的知识?
【问题讨论】:
标签: apache-spark pyspark azure-databricks azure-synapse