【发布时间】:2021-02-14 19:34:49
【问题描述】:
我有一个kafka生产者以
格式发送大量数据{
'1000':
{
'3':
{
'seq': '1',
'state': '2',
'CMD': 'XOR'
}
},
'1001':
{
'5':
{
'seq': '2',
'state': '2',
'CMD': 'OR'
}
},
'1003':
{
'5':
{
'seq': '3',
'state': '4',
'CMD': 'XOR'
}
}
}
....
我想要的数据在最后一个循环中:{'seq': '1', 'state': '2', 'CMD': 'XOR'} 上面循环中的键('1000' and '3') 是可变的。请注意,上述值仅作为示例。原始数据集很大,有很多可变键。只有最终循环中的键{'seq', 'state', 'CMD'} 是常量。
我尝试使用通用格式来读取数据,但由于上面的循环具有可变键,因此我得到了不正确的数据,我不确定如何定义架构来解析这种数据格式。
我试图实现的输出是格式的数据框
seq state CMD
----------------------
1 2 XOR
2 2 OR
3 4 XOR
【问题讨论】:
-
最终结果如何?你愿意把它作为一个数据框吗?对预期输出的更多说明将在这里有所帮助
-
@dsk... 我已经添加了预期的输出。感谢您的评论。
-
您现在能否检查一下下面的解决方案是否是您正在寻找的东西 - 如果您能接受并投票,将不胜感激.. :)
标签: json dataframe pyspark apache-kafka spark-streaming