【问题标题】:randomly select observation from each frequency bin [duplicate]从每个频率箱中随机选择观察值[重复]
【发布时间】:2019-09-26 22:28:16
【问题描述】:

我想将我的数据分成 100 个频率区间,然后从每个频率区间中随机选择一个观察值。

我有一个数据框,其中包含语料库中的单词及其频率,如下所示:

word | frequency
---- | ---------
a    | 72387
and  | 112091
that | 87164
to   | 71474
the  | 98422
etc.

我知道我可以使用cut 函数对数据进行分类,但我不确定如何从每个频率分类中随机选择一个词。

【问题讨论】:

  • 不要在问题中添加答案 - 具体解释为什么重复项不适用于问题,然后您可以在重新打开时发布答案。

标签: r


【解决方案1】:

一个整洁的答案是:

d <- iris %>% 
  mutate(bin = ntile(Species, 100)) %>%
  group_by(bin) %>%
  sample_n(1) %>%
  ungroup()

您可以将“iris”替换为您的 df,将“Species”替换为您想要分类的列。

【讨论】:

    猜你喜欢
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2018-03-28
    • 1970-01-01
    • 1970-01-01
    • 2019-05-07
    • 1970-01-01
    相关资源
    最近更新 更多