【发布时间】:2020-08-19 14:26:51
【问题描述】:
我有两个具有相同列名的文件。我通过阅读这些CSV 文件创建了两个数据框。考虑一个名为Units Sold 的列。默认情况下,当我检查架构时,它的数据类型是string。现在,我想在两个数据框中遍历该列的每一行数据,并检查数据类型是否正确。
如果一个文件中的一列是numeric,那么如果一个文件的值是345,另一个文件的值是345.00,那么第二个文件的列应该是相同的,然后突出显示,因为这里的数据类型不同.我尝试了下面的东西,但这非常通用:
types1=[df1.dtypes]
#print(types1)
types2 =[df2.dtypes]
#print(types2)
if(types1==types2):
print("Data types is equal for both the files..")
else:
print("Data types is NOT equal for both the files..")
以下是列和示例数据:
Units Sold
8446
3018
1517
3322
9845
9528
我没有找到任何与我的问题相关的帖子。任何帮助表示赞赏。
【问题讨论】:
标签: python apache-spark hadoop pyspark