【发布时间】:2020-10-23 08:32:30
【问题描述】:
我有一个包含 23 列和 8124 行的 df。在第一列(命名类型)中只有两个值“e”或“p”。 现在我需要创建两个不同的df:
- 第一个 df 必须包含 5686 行(大约 70% 的行),同时“e”和“p”的数量必须相同(e 的 50% 和 p 的 50%)。
- 第二个 df 必须包含剩余的行。
重要的是,所有这些行必须由原始 df 随机选择(不允许重复)。
编辑:元素 e 和 p 的行数不够,所以我不得不牺牲一些距离
【问题讨论】:
-
完整数据框中“e”和“p”行的频率是否也是50%?