【发布时间】:2019-09-23 12:17:47
【问题描述】:
我有一堆名字(> 1000 万)及其相关数量的数据。
import pandas as pd
import numpy as np
data = {
"Name": ['Sara', 'John', 'Mark', 'Peter', 'Kate'],
"Count": [20, 10, 5, 2, 5],
}
df = pd.DataFrame(data)
print(df)
Name Count
0 Sara 20
1 John 10
2 Mark 5
3 Peter 2
4 Kate 5
我想计算Count 列的熵,而不将数据扩展为[Sara, Sara, Sara,...,Kate, Kate, Kate],因为对此有太多的观察。
如何在不扩展数据的情况下计算 Count 的熵?
【问题讨论】:
-
定义熵。
-
通过将计数转换为 bin 概率(每个计数除以总计数)并求和 -pi*log(pi) (请参阅stackoverflow.com/questions/15450192/…),不容易根据计数计算熵跨度>
标签: python pandas numpy dataframe entropy