【发布时间】:2019-09-29 10:24:42
【问题描述】:
我正在尝试读取 .csv 文件并提取特定列,以便我可以输出一个表,该表基本上对特定列执行“GROUP BY”并聚合某些其他感兴趣的列(类似于您如何会在 SQL 中)但我不太熟悉如何在 Python 中轻松地做到这一点。
csv文件格式如下:
age,education,balance,approved
30,primary,1850,yes
54,secondary,800,no
24,tertiary,240,yes
我尝试导入并读取 csv 文件以解析我关心的三列并遍历它们以将它们放入三个单独的数组列表中。我不太熟悉包以及如何将它们放入具有 3 列的数据框或矩阵中,以便我可以遍历它们进行变异或执行所有聚合输出字段(请参阅下面的预期结果)。
with open('loans.csv') as csvfile:
readCSV = csv.reader(csvfile, delimiter = ',')
next(readCSV) ##skips header row
education = []
balance = []
loan_approved = []
for row in readCSV:
educat = row[1]
bal = row[2]
approve = row[3]
education.append(educat)
balance.append(bal)
loan_approved.append(approve)
print(education)
print(balance)
print(loan_approved)
输出将是一个 4x7 的四行表格(按教育程度分组)和以下标题:
Education|#Applicants|Min Bal|Max Bal|#Approved|#Rejected|%Apps Approved
Primary ...
Secondary ...
Terciary ...
【问题讨论】:
-
您的标签中列出了熊猫,但您没有显示任何熊猫代码。您尝试过使用该 API 做什么?
标签: python pandas csv pandas-groupby