【发布时间】:2023-02-23 00:49:49
【问题描述】:
使用以下方法生成示例数据框:
import pandas as pd
pd.DataFrame({'A': [{'A', 'B'}, {'A', 'B', 'C', 'E'}, {'B', 'D'}, {'C', 'B'}, {'A', 'B', 'D'}, {'X'}], 'B': [111, 222, 333, 444, 555, 666]})
看起来像这样:
我需要根据基于“子集”关系的“A”列值按数据框分组,即
- 第一组将包括索引 0、1、3;
- 第二组将包括索引 2、4;
- 第三组将包括索引 4。
因为 {'A', 'B'} 和 {'C', 'B'} 是 {'A', 'B', 'C', 'E'} 的子集,而 {'B', 'D' } 是 {'A', 'B', 'D'} 的子集。 {'X'} 不是 A 列中任何其他值的子集。
有什么办法可以做到这一点?谢谢!
【问题讨论】:
-
你不是早就问过这个问题了吗? :-) 到目前为止你尝试了什么?
-
如果你也有
{A, B, D}行怎么办?输出结果是什么? -
热烈欢迎来到 SO。请阅读stackoverflow.com/help/how-to-ask和stackoverflow.com/help/minimal-reproducible-example。然后用代码更新您的问题,向我们展示您到目前为止所做的尝试。
标签: pandas dataframe set subset