【发布时间】:2017-12-10 20:18:31
【问题描述】:
我正在尝试在 csv 中迭代超过 500 万条记录。我被以下循环困住了。
trajectory = 0
for index, row in df.iterrows():
if row['trajectory'] == 'NaN':
trajectory = trajectory +1
df.loc[index, 'classification']= trajectory
else:
df.loc[index, 'classification'] = trajectory
当我在 DataFrame 中遇到“NaN”时,我会增加我的轨迹值并将该值放入我的“分类”列中。
我尝试使用较小的数据集,但是当我在完整的 .5 gig csv 中运行此代码时,需要数小时。
【问题讨论】:
标签: python pandas dataframe bigdata