【问题标题】:Date histogram per minutes in pandas大熊猫每分钟的日期直方图
【发布时间】:2020-10-27 15:39:04
【问题描述】:

我正在尝试使用 pandas 绘制一个简单的日期直方图(仅计算每 N 分钟的出现次数)。 然而,我所能达到的最好的是:

import pandas as pd
df = pd.read_csv('mydata.csv',sep=' ',usecols=[0,1])
df.columns = ['smdate', 'smtime']
df= pd.to_datetime(df['smtime'])
print(df)
df.groupby(df.dt.minute).count().plot(kind="bar",figsize=(50,10))

样本输出:

0        2020-07-07 00:00:07.538
1        2020-07-07 00:00:09.278
2        2020-07-07 00:00:09.292
3        2020-07-07 00:00:10.682
4        2020-07-07 00:00:14.198
                   ...          
262516   2020-07-07 15:54:44.056
262517   2020-07-07 15:54:44.270
262518   2020-07-07 15:54:44.450
262519   2020-07-07 15:54:44.697
262520   2020-07-07 15:54:45.210
Name: smtime, Length: 262521, dtype: datetime64[ns]

情节

我的问题是如何最好地分组我的框架(即按 10-20 分钟)? 另外,绘制这么多事件的最佳方法是什么,以便我可以按照上述间隔(每 N 分钟)可视化它们?

【问题讨论】:

  • 我没有 pandas 的答案,但你可能会创建一个新列,其中包含一些值来指示哪个间隔(即 1:第一个间隔、2:下一个间隔等)和 groupby 等.至于可视化,我不确定,但一旦你把它分组,应该很容易找到解决方案。

标签: python pandas plot histogram date-histogram


【解决方案1】:

我想你正在寻找熊猫Grouper。
它允许您指定所需的任何频率或间隔。

这是一个间隔 10 分钟的工作示例:

import pandas as pd
df = pd.read_csv('mydata.csv',sep=';',usecols=[0,1])
df.columns = ['smdate', 'smtime']

df['smtime'] = pd.to_datetime(df['smtime'])

df.groupby(pd.Grouper(key='smtime', freq='10Min')).count().plot(kind="bar",figsize=(50,10))

在这里,我保留了初始数据帧结构;我无法让它与 datetime Series 对象一起工作(Grouper 函数尝试处理索引而不是系列的值)。我尝试了轴参数但没有成功。如果有人可以直接使用该系列改进我的答案,我会很高兴。

无效示例:

import pandas as pd
df = pd.read_csv('mydata.csv',sep=';',usecols=[0,1])
df.columns = ['smdate', 'smtime']

df = pd.to_datetime(df['smtime'])

df.groupby(pd.Grouper(freq='10Min')).count().plot(kind="bar",figsize=(50,10))

【讨论】:

    猜你喜欢
    • 2018-05-01
    • 1970-01-01
    • 2019-02-09
    • 2013-10-26
    • 2020-05-20
    • 2018-12-31
    • 2020-07-19
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多