【发布时间】:2021-07-03 14:33:57
【问题描述】:
我有一个如下所示的数据框
df = pd.DataFrame({'text': ["Hi how","I am fine","Ila say Hi"],
'tokens':[['Hi','how'],['I','am','fine'],['Ila','say','Hi']],
'labels':[['A','B'],['C','B','A'],['D','B','A']]})
我想做两件事
a) 每个标签的计数
b) 计算每个标签下的标记
我正在尝试类似下面的东西
flattened = []
op = itertools.zip_longest(df['tokens'],df['labels'])
for i in op:
for la in df['labels']:
if la == 'A' :
flattened.append(val)
但这是不正确的,而且无处可去
我希望我的输出有两个数据框/表,如下所示
【问题讨论】:
标签: python python-3.x pandas dataframe nlp