【发布时间】:2020-01-25 21:04:25
【问题描述】:
我有一个像这样的数据框:
Time Frq_1 Seq_1 Frq_2 Seq_2 Frq_3 Seq_3
12:43:04 - 30,668 - 30,670 4,620 30,671
12:46:05 - 30,699 - 30,699 3,280 30,700
12:46:17 4,200 30,700 - 30,704 - 30,704
12:46:18 3,060 30,700 4,200 30,700 - 30,700
12:46:18 3,060 30,700 4,200 30,700 - 30,700
12:46:19 3,060 30,700 4,220 30,700 - 30,700
12:46:20 3,060 30,700 4,240 30,700 - 30,700
12:46:37 - 30,698 - 30,699 3,060 30,700
12:46:38 - 30,699 3,060 30,700 4,600 30,700
12:47:19 - 30,668 - 30,669 - 30,669
12:47:20 - 30,667 - 30,667 - 30,668
12:47:20 - 30,667 - 30,667 - 30,668
12:47:21 - 30,667 - 30,667 - 30,668
12:47:21 - 30,665 - 30,665 - 30,665
12:47:22 - 30,665 - 30,665 - 30,665
12:48:35 - 30,688 - 30,690 3,020 30,690
12:49:29 4,160 30,690 - 30,691 - 30,693
我想检查总数据框并找到以下条件的结果:
- Frequency 不为空的Sequence_ID
- Frequency 为 Max 的 Sequence_ID(在多个 Sequence_ID 的频率非零的情况下)
我希望我的结果如下:
Time Sequence_ID Frequency
12:43:04 4,620 30,671
12:46:18 4,200 30,700
12:49:29 4,160 30,690
时间 = 对应于 (Sequence_ID & Frequency) 的行
【问题讨论】:
-
以后,我建议您尽可能多地关注问题。这里发生了很多;未存储为数字类型的数字,未正确表示的缺失数据,然后是您真正想要实现的逻辑。正如您所看到的,这些类型的问题的答案被所有需要采取的预处理和外围步骤弄糊涂了,这使得这些问题对未来用户的用处大大降低。这会导致对该问题投反对票,并且尽管需要付出巨大的努力,但答案往往没有得到尽可能多的赞成票。
-
对不起。我已根据需要编辑了问题。
标签: python python-3.x pandas numpy list-comprehension