【发布时间】:2021-07-09 00:27:57
【问题描述】:
我在胶水中有一个 pyspark 代码,我想创建一个数据框,其映射结构是整数和字符串的组合。
样本数据:
{ "Candidates": [
{
"jobLevel": 6,
"name": "Steven",
}, {
"jobLevel": 5,
"name": "Abby",
} ] }
因此,我尝试使用以下代码来创建地图数据类型。但是每次整数数据类型 jobLevel 被转换为字符串数据类型。有什么建议可以通过保留作业级别的数据类型来完成这项工作?
使用的代码:
df = spark.sql("select Supervisor_name,
map('job_level', INT(job_level_name),
'name', employeeLogin) as Candidates
from dataset_1")
【问题讨论】:
标签: dataframe pyspark apache-spark-sql aws-glue aws-glue-spark