【发布时间】:2019-12-10 10:40:39
【问题描述】:
我正在研究如下道路事故数据集
df = pd.DataFrame(data={'accident_id': ['A1', 'A2', 'A3', 'A4','A5', 'A6'],
'accident_county': ['abc', 'xyz', 'abc', 'abc', 'xyz', 'lmn'],
'population': [100000, 6000, 100000, 100000, 6000, 9000],
'income': [11200, 78000, 11200, 11200, 78000, 28000]})
accident_id accident_county population income
A1 abc 100000 11200
A2 xyz 6000 78000
A3 abc 100000 11200
A4 abc 100000 11200
A5 xyz 6000 78000
A6 lmn 9000 28000
我想绘制图表,以便我可以分析特定县发生的事故数量以及该县的人口和收入情况,试图找出与人口数量和收入是否有任何相关性。
事故的数量可以通过记录的数量找到,但我不知道如何找到一个县的计数并将其与该县的人口和收入进行比较。
【问题讨论】:
-
你能告诉我们你到目前为止尝试了什么吗?请检查How to ask和How to create a Minimal, Reproducible Example
-
您是否尝试过使用
.groupby? -
如果您有事故日期,则将一年中的事故数量、平均人口和一年的收入相加,然后按人口或收入列升序排列生成的时间数据并绘制 XY 图的那种关系。如果存在具有相同人口/收入金额的重复项,您可能需要对事故数量进行二阶平均,从而导致事故计数不同。
标签: python pandas matplotlib data-visualization