【问题标题】:Resampling time series data from one column into multiple columns in python在python中将时间序列数据从一列重新采样为多列
【发布时间】:2021-06-26 04:02:31
【问题描述】:

我正在尝试将以下数据集中的“lang”列重新采样为两列,告诉我们每个时期(假设是每周)中每个值(“zh”和“en”)的计数,给定数据集是一个熊猫数据框。有谁知道我怎么做?我发现 .resample() 可能是一种出路,但我只能找到处理列内数据的示例。谢谢!

    date    lang
2019-05-01 07:59:42+00:00   zh
2019-05-04 07:57:53+00:00   en
2019-05-06 07:52:40+00:00   zh
2019-05-08 07:43:38+00:00   en
2019-05-10 07:40:40+00:00   zh
2019-05-13 07:37:25+00:00   zh
2019-05-16 07:31:55+00:00   zh
2019-05-18 07:15:53+00:00   en

【问题讨论】:

  • 我不明白这个问题。对于给定的输入,输出应该是什么?
  • 输出应该包含多个来自“lang”的列,以便显示“lang”中每个值的计数,例如日期zh en 2019-05-01 2 1

标签: python pandas time-series


【解决方案1】:

用途:

df.groupby([pd.Grouper(freq='W', key='date'), 'lang']).size().unstack(fill_value=0)

【讨论】:

    猜你喜欢
    • 1970-01-01
    • 1970-01-01
    • 2014-12-15
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2020-12-28
    • 2021-06-05
    • 1970-01-01
    相关资源
    最近更新 更多