【发布时间】:2022-01-03 03:10:26
【问题描述】:
我正在尝试将列表转换为 pyspark 中的数据框,以便我可以将其作为列加入更大的数据框。列表中的数据是随机生成的名称,如下所示:
from faker import Faker
from pyspark.sql.functions import *
import pyspark.sql.functions as F
from pyspark.sql.types import *
faker = Faker("en_GB")
list1 = [faker.first_name() for _ in range(0, 100)]
firstname = sc.parallelize([list1])
schema = StructType([
StructField('FirstName', StringType(), True)
])
df = spark.createDataFrame(firstname, schema)
display(df)
但是我收到了这个错误:
PythonException: 'ValueError: 对象长度 (100) 与字段长度 (1) 不匹配'。
任何有关导致此问题的原因以及如何解决此问题的想法都非常感谢!
非常感谢,
卡罗来纳
【问题讨论】:
标签: python dataframe apache-spark pyspark