【发布时间】:2017-03-11 18:07:11
【问题描述】:
拥有 MultiIndex Pandas DataFrame,如何在不丢失索引的情况下将其转换为 Spark DataFrame。这可以使用玩具示例轻松测试:
arrays = [['bar', 'bar', 'baz', 'baz', 'foo', 'foo', 'qux', 'qux'],
['one', 'two', 'one', 'two', 'one', 'two', 'one', 'two']]
tuples = list(zip(*arrays))
index = pd.MultiIndex.from_tuples(tuples, names=['first', 'second'])
df = pd.DataFrame(np.random.randn(8, 4), index=arrays)
df_spark = sqlContext.createDataFrame(df)
错过所有索引。为了保留索引,我还需要处理其他事情吗?
【问题讨论】:
标签: pandas apache-spark pyspark apache-spark-sql multi-index