【问题标题】:Create date range list with pandas使用熊猫创建日期范围列表
【发布时间】:2020-12-23 01:43:26
【问题描述】:

我得到了包含 'start_date' 和 'end_date' 列的 DataFrame。

    start_date  finish_date
0   2019-06-16  2019-06-23
1   2019-05-29  2019-06-05
2   2019-03-26  2019-03-28
3   2019-04-22  2019-04-24
4   2019-05-08  2019-05-08

我想创建一个包含此范围内月份列表的列,如下所示:

    start_date  finish_date  range
0   2019-06-16  2019-06-23  [2019-06]
1   2019-05-29  2019-06-05  [2019-05, 2019-06]
2   2019-03-26  2019-03-28  [2019-03]
3   2019-04-22  2019-08-24  [2019-04, 2019-05, 2019-06, 2019-07]
4   2018-12-08  2019-02-08  [2018-12, 2019-01, 2019-02]

我尝试使用 period_range:

df['range'] = df.apply(lambda x: pd.period_range(start=df['start_date'], end=df['finish_date'], freq='M'))

类似这样的事情,但我得到的只是错误。 请您帮帮我 - 是否可以使用 period_range/date_range 来解决我的问题?

感谢您的宝贵时间!

【问题讨论】:

  • df['range'] = df.apply(lambda x: pd.period_range(start=x['start_date'], end=x['finish_date'], freq='M') )
  • This answer 解释了@BEN_YO 评论中使用的方法。
  • @BEN_YO 的回答会奏效。您将 x 传递给您的 lambda 函数,而不是整个 df。
  • 非常感谢!
  • @RustemNagimov 也添加,axis=1

标签: python pandas


【解决方案1】:

试试:

df['range'] = pd.Series([pd.date_range(i, j, freq='D').strftime('%Y-%m').unique().to_numpy() 
                         for i, j in zip(df['start_date'], df['finish_date'])])
print(df)

输出:

  start_date finish_date                                          range
0 2019-06-16  2019-06-23                                      [2019-06]
1 2019-05-29  2019-06-05                             [2019-05, 2019-06]
2 2019-03-26  2019-03-28                                      [2019-03]
3 2019-04-22  2019-08-24  [2019-04, 2019-05, 2019-06, 2019-07, 2019-08]
4 2018-12-08  2019-02-08                    [2018-12, 2019-01, 2019-02]

【讨论】:

  • 非常感谢 :) 它有效,但有趣的是 - 最后 N 行只有 NaN
  • 你能创建一个小数据集来产生 NaN 吗?
猜你喜欢
  • 2018-07-13
  • 2021-06-30
  • 2016-10-05
  • 2018-04-01
  • 1970-01-01
  • 2019-07-07
  • 2021-12-29
  • 2019-09-04
相关资源
最近更新 更多