【问题标题】:How can I add below customized columns in dataframe?如何在数据框中添加以下自定义列?
【发布时间】:2020-06-12 07:17:10
【问题描述】:
import pandas as pd
import numpy as np

#Create a Dictionary of series
d = {'Name':pd.Series(['Tom','James','Ricky','','Steve','Tom','Jack',
   'Lee','David','','Betina','Andres']),
   'Age':pd.Series([25,,25,23,30,29,23,'NULL',40,30,51,46]),
   'Rating':pd.Series([4.23,3.24,3.98,2.56,3.20,4.6,3.8,3.78,2.98,4.80,4.10,3.65])
}

#Create a DataFrame
df = pd.DataFrame(d)

summary = df.describe(include='all').T
print(summary)

如何创建两列来获取 total_duplicate_value_count 和 total_null_value_count。然后将其添加到现有的 summary 数据框中?

Expected Output :
column_name     total_null_value_count  total_duplicate_value_count    count  ...
Name            2                       1                              12     ...
Age             2                       3                              12     ...
Rating          0                       0                              12     ...

【问题讨论】:

  • 请发布您的预期输出。
  • @MayankPorwal 更新了预期的输出。

标签: python python-3.x pandas metrics summary


【解决方案1】:

首先追加空值计数isna().sum()作为新行,转置,然后追加新列,countunique之间的差异作为重复计数:

df.describe(include='all').append(df.isna().sum().rename('total_null_value_count')).T.assign(total_duplicate_count = df.describe(include='all').loc['count'] - df.describe(include='all').loc['unique'])

【讨论】:

    猜你喜欢
    • 1970-01-01
    • 2020-09-19
    • 2021-01-02
    • 2016-12-29
    • 2013-01-06
    • 2018-10-27
    • 1970-01-01
    • 2023-01-19
    • 1970-01-01
    相关资源
    最近更新 更多