【发布时间】:2020-01-11 09:37:35
【问题描述】:
总结: 我的代码输出为我提供了以下格式的数据框。数据框的列标题是Content 列中文本的标签。这些标签将在下一步中用作多标签分类器的训练数据。这是一个更大的实际数据的 sn-p。
由于它们是列标题,因此无法将它们映射到它们作为标签的文本。
Content A B C D E
zxy 1 2 1
wvu 1 2 1
tsr 1 2 2
qpo 1 1 1
nml 2 2
kji 1 1 2
hgf 1 2
edc 1 2 1
更新:将 df 转换为 csv 显示空单元格为空白('' vs ' '):
其中Content是文本所在的列,A、B、C、D和E是需要转为标签的列标题。只有带有 1 或 2 的列是相关的。具有空单元格的列不相关,因此不需要转换为标签。
更新:经过一番挖掘,也许数字可能不是整数,而是字符串。
我知道在将文本+标签输入分类器进行处理时,两个数组的长度需要相等,否则不被接受为有效输入。
有没有办法可以将列标题转换为 DF 中 Content 中文本的标签?
预期输出:
>>Content A B C D E Labels
0 zxy 1 2 1 A, B, D
1 wvu 1 2 1 A, C, D
2 tsr 1 2 2 A, B, E
3 qpo 1 1 1 B, C, D
4 nml 2 2 C, D
5 kji 1 1 2 A, C, E
6 hgf 1 2 C, E
7 edc 1 2 1 A, B, D
【问题讨论】:
-
你有链接或 git repo 我可以看到实际数据吗?
-
似乎空白处是空格
' '。 -
我可以从那张截图中看到,与玩具数据相比,数据有所不同。假设是,只有
Content列有实际文本,而其他列只有空白或数字。看起来很多列都有文字,这可以解释为什么没有任何效果。 -
是的,例如
s=df.loc[:,'A':]:A:表示从A向右的所有列,第一个:表示所有行。真实数据中的列名是否不同? -
嗯,这需要一些努力。欢呼!祝你好运。
标签: python python-3.x pandas csv dataframe