【发布时间】:2014-05-21 04:05:44
【问题描述】:
我在 pandas 中有一个包含 19,000,000 行的数据框。标题是艺术家和周。我想添加另一列,用于计算艺术家在给定一周内出现的次数。现在我正在使用以下代码:
#Function to determine the number
def playsxweek(week,art):
return len(data[(data.week == week) & (data.artist == art)])
#Then I map
data['playsxweek'] = map(playsxweek,data['week'],data['artist'])
现在代码需要很长时间才能处理所有 1900 万条记录...有更好的方法吗?
【问题讨论】:
标签: python optimization map pandas bigdata