【发布时间】:2023-03-11 00:07:01
【问题描述】:
给定一个pandasDataFrame,其中包含group、x 和y 的列(每个group 值有多个记录),我想创建一个新的DataFrame 一行根据group 和该组中x 和y 值的相关t 统计量。我想用groupby 来做这件事,而不是循环。
例子:
import pandas as pd
import numpy as np
from scipy import stats
N = 100 # Observations per group.
tt_df = pd.DataFrame({'group': np.append(['A'] * N, ['B'] * N),
'x': np.random.randn(2 * N)})
tt_df['y'] = tt_df['x'] + np.random.randn(2 * N)
stats.ttest_ind(tt_df['x'], tt_df['y'])[0] # -0.32 global t statistic.
【问题讨论】:
标签: python pandas scikit-learn pandas-groupby