【发布时间】:2017-01-31 10:08:04
【问题描述】:
我有一个如下所示的数据集:
text id screenName retweetCount isRetweet retweeted longitude latitude
1 xx 778980737861062656 0504Traveller 0 FALSE FALSE <NA> <NA>
2 xx 778967536167559168 Iz_Azman 0 FALSE FALSE <NA> <NA>
3 yy 778962265298960384 Iz_Azman 0 FALSE FALSE <NA> <NA>
4 yy 778954988122939392 travelindtoday 2 FALSE FALSE <NA> <NA>
5 zz 778948691969224705 umtn 2 FALSE FALSE <NA> <NA>
6 zz 778942095843135493 flyinsider 0 FALSE FALSE <NA> <NA>
这些是 R 中 twittR 包中的推文。一些推文具有完全相同的 text 但不同的 retweetCount。我想保留唯一的推文(text),但保留那些具有最高 retweetCount 的推文。 (在上述情况下,推文 1、4 和 5。)
我该怎么做?
【问题讨论】:
标签: r twitter duplicates