【发布时间】:2020-12-15 07:33:45
【问题描述】:
问题
我有一个 pandas 数据框,我需要计算数据框中每个唯一条目出现在每个其他条目的同一行中的行数。
相关但不同的帖子
- Co-occurrence Matrix from list of words in Python: 与我的类似问题,但不是从数据框开始。大多数答案使用迭代。我希望 Pandas 中存在更好的解决方案。
- Constructing a co-occurrence matrix in python pandas: 这已经从正文中只有 0 和 1 的数据框开始(我猜代表实际值?)但不是实际值。
- Convert Two column data frame to occurrence matrix in pandas: 这篇文章假设只有两列,这对于这里讨论的情况相当限制
可重复设置
import pandas as pd
import numpy as np
数据框:
df = pd.DataFrame({'a': ['A', 'A', 'B', 'B'],
'b': ['B', 'C', 'B', 'B'],
'c': ['C', 'A', 'C', 'A'],
'd': ['B', 'D', 'B', 'A']},
index=[0, 1, 2, 3])
即:
+----+-----+-----+-----+-----+
| | a | b | c | d |
|----+-----+-----+-----+-----|
| 0 | A | B | C | B |
| 1 | A | C | A | D |
| 2 | B | B | C | B |
| 3 | B | B | A | A |
+----+-----+-----+-----+-----+
(使用this打印。)
我尝试过的
我尝试使用code from answer,并替换这些变量:
document = [list(each) for each in df.values]
names = list(np.unique(df.values))
它给出了错误的结果:
A B C D
A 4 6 3 2
B 6 10 5 0
C 3 5 0 1
D 2 0 1 0
它是基于迭代的,所以我希望有更好的解决方案。
预期输出
+----+-----+-----+-----+-----+
| | A | B | C | D |
|----+-----+-----+-----+-----|
| A | nan | 2 | 2 | 1 |
| B | 2 | nan | 2 | 0 |
| C | 2 | 2 | nan | 1 |
| D | 1 | 0 | 1 | nan |
+----+-----+-----+-----+-----+
2 行同时出现A 和B,因此单元格行A 列B 中的值为2。
有2行A和C都出现了,所以单元格行A列C的值为2。
问题
如何在 Pandas 中轻松获得此逐行共现矩阵?如果我不必遍历这些值,那就太好了。
(pandas.Categorical 可能有点用,我还没有成功。)
【问题讨论】:
-
你有两行包含
AC:-) -
哦,是的,没错!已更正! :)(对不起)
标签: python python-3.x pandas dataframe