【发布时间】:2017-06-15 14:42:35
【问题描述】:
有没有办法检查当前行中的所有列值是否小于 pandas 数据帧(整个数据帧)中所有先前行(直到当前行)中的相应列值,并创建一个新列相应的值是 1 还是 0?
【问题讨论】:
有没有办法检查当前行中的所有列值是否小于 pandas 数据帧(整个数据帧)中所有先前行(直到当前行)中的相应列值,并创建一个新列相应的值是 1 还是 0?
【问题讨论】:
考虑数据框df
np.random.seed(1)
df = pd.DataFrame(np.random.rand(10, 2), columns=list('AB'))
df
A B
0 0.417022 0.720324
1 0.000114 0.302333
2 0.146756 0.092339
3 0.186260 0.345561
4 0.396767 0.538817
5 0.419195 0.685220
6 0.204452 0.878117
7 0.027388 0.670468
8 0.417305 0.558690
9 0.140387 0.198101
选项 1cummin 和 shift
这里的概念是跟踪到目前为止每列的最小值。如果特定行上的值小于前一行及其之前的所有行,则它必须是新的最小值。我们可以通过检查它是否小于前一行的最小值来判断这是否是True。
注意这应该可以很好地处理NaN 值。
df.assign(New=(df < df.cummin().shift()).all(1).astype(int))
A B New
0 0.417022 0.720324 0
1 0.000114 0.302333 1
2 0.146756 0.092339 0
3 0.186260 0.345561 0
4 0.396767 0.538817 0
5 0.419195 0.685220 0
6 0.204452 0.878117 0
7 0.027388 0.670468 0
8 0.417305 0.558690 0
9 0.140387 0.198101 0
选项 2numpy 版本numpy.minimum
v = df.values
c = np.minimum.accumulate(v[:-1], axis=0)
df.assign(New=np.append(False, (v[1:] < c).all(1)).astype(int))
A B New
0 0.417022 0.720324 0
1 0.000114 0.302333 1
2 0.146756 0.092339 0
3 0.186260 0.345561 0
4 0.396767 0.538817 0
5 0.419195 0.685220 0
6 0.204452 0.878117 0
7 0.027388 0.670468 0
8 0.417305 0.558690 0
9 0.140387 0.198101 0
【讨论】:
使用@piRsuared 的 DF:
np.random.seed(1)
df = pd.DataFrame(np.random.rand(10, 2), columns=list('AB'))
Out[31]:
A B
0 0.417022 0.720324
1 0.000114 0.302333
2 0.146756 0.092339
3 0.186260 0.345561
4 0.396767 0.538817
5 0.419195 0.685220
6 0.204452 0.878117
7 0.027388 0.670468
8 0.417305 0.558690
9 0.140387 0.198101
您可以使用 apply 将当前行与所有先前行的最大值进行比较,然后将结果转换为 int。
df.apply(lambda x: (x<df[0:x.name].max()).all().astype(int),axis=1)
Out[30]:
0 0
1 1
2 1
3 1
4 1
5 0
6 0
7 1
8 1
9 1
dtype: int64
【讨论】: