【发布时间】:2020-04-18 13:29:28
【问题描述】:
我有多个 csv 文件,对应于我所在国家/地区的大学入学成绩,除以年份。
每个 csv 文件由 7 列组成:
"Institution Code", "Curse Code", "Institution", "Course", NrVacanciesYear", "NrPlacedYear", "LastGradeYear".
我正在尝试将 21 个文件(从 1997 年到 2018 年)连接到一个文件中,并按年份连接列。
我正在尝试使用
dffinal_conc = pd.concat([df18, df17], ignore_index=True)
但我在按“机构代码”和“课程代码”分组时遇到问题(注意:来自不同机构的相同课程具有相同的 ID!)
当我尝试使用它时
dffinal_conc = pd.concat([df18, df17], axis = 1)
它有点按课程和机构代码分组,但当我尝试使用时,我不知道我是否做得正确
dffinal_conc['Código Curso'].value_counts()
为了验证 ID 只有 1 个值,我得到一个错误:
AttributeError: 'DataFrame' 对象没有属性 'value_counts'"
(注意:我使用dffinal_conc2.loc[:,~dffinal_conc2.columns.duplicated()] 删除重复项)
感谢您的帮助!
【问题讨论】:
-
制作 2 个小型数据框,用于描述您的问题陈述,并向我们展示基于 2 个示例输入数据框的示例输出。您可以从这里获得帮助:how to provide a great pandas example