【发布时间】:2018-10-07 07:01:48
【问题描述】:
我正在加载一个带有熊猫的 CSV 文件。它包含三列:一个包含日期和时间的列,一个包含用户 ID 的列,以及另一个“campaignID”。 示例行:
date user_id campaign_id
2018-01-10 0:21:09 151312395 GOOGLE
2018-01-10 0:21:19 151312395 GOOGLE
2018-01-10 0:21:32 151312395 GOOGLE
我想按用户 ID 对数据进行分组,然后为每个用户 ID 按时间和活动 ID 对行进行分组,应该如下所示。
user_id date ad_campaign
151312395 2018-01-10 0:21:09 GOOGLE
2018-01-10 0:21:19 GOOGLE
2018-01-10 0:21:32 GOOGLE
这是我到目前为止所做的: 将熊猫导入为 pd 将 numpy 导入为 np 导入日期时间
def dateparse(time_in_secs):
return datetime.datetime.fromtimestamp(float(time_in_secs))
columnnames = ['date','user_id', 'ad_campaign']
columnnames, sep='\t' ,usecols=[0,1,3],index_col = 'date')
df=pd.read_csv(r'C:\Users\L\Desktop\Data.csv' ,
sep='\t',names = columnnames, usecols=[0,1,3],
parse_dates=True,date_parser=dateparse)
df.date = pd.to_datetime(df.date)
df = df.sort_values(by = 'date')
g = df.groupby('user_id')['ad_campaign']
print(g)
这给出了以下输出:
<pandas.core.groupby.SeriesGroupBy object at 0x04EF26F0>
[Finished in 0.6s]
为什么打印不提供排好序的列?
【问题讨论】:
标签: python pandas csv pandas-groupby