【问题标题】:Re-arrange and aggregate R Rows重新排列和聚合 R 行
【发布时间】:2017-11-19 04:37:06
【问题描述】:

编辑 --- 我已将问题清理为范围更小。

我正在尝试以以下形式聚合数据框,但已卡住。

这是来自电话系统的 isdn 日志输出,因此它包含在整个日志中同时发生的呼叫。这些呼叫属于呼入性质而不是呼出性质。

数据框如下所示:

"V1" "V2""V3""V4"   "V5"        "V6"        "V7"                   "V8"
"1" "Oct" "" "2" "00:00:01" "10.20.5.31" "82189056:" "Oct  2 00:00:01.326 AEDST: ISDN Se0/0/0:15 Q931: RX <- SETUP pd = 8  callref = 0x174E "
"2" "Oct" "" "2" "00:00:01" "10.20.5.31" "82189057:" "  Bearer Capability i = 0x8090A3 "
"3" "Oct" "" "2" "00:00:01" "10.20.5.31" "82189058:" "      Standard = CCITT "
"4" "Oct" "" "2" "00:00:01" "10.20.5.31" "82189059:" "      Transfer Capability = Speech  "
"5" "Oct" "" "2" "00:00:01" "10.20.5.31" "82189060:" "      Transfer Mode = Circuit "
"6" "Oct" "" "2" "00:00:01" "10.20.5.31" "82189061:" "      Transfer Rate = 64 kbit/s "
"7" "Oct" "" "2" "00:00:01" "10.20.5.31" "82189062:" "  Channel ID i = 0xA1839B "
"8" "Oct" "" "2" "00:00:01" "10.20.5.31" "82189063:" "      Preferred, Channel 27 "
"9" "Oct" "" "2" "00:00:01" "10.20.5.31" "82189064:" "  Calling Party Number i = 0x2183, '00123456789' "
"10" "Oct" "" "2" "00:00:01" "10.20.5.31" "82189065:" "     Plan:ISDN, Type:National "
"11" "Oct" "" "2" "00:00:01" "10.20.5.31" "82189066:" " Called Party Number i = 0xC1, '0123456' "
"12" "Oct" "" "2" "00:00:01" "10.20.5.31" "82189067:" "     Plan:ISDN, Type:Subscriber(local) "
"13" "Oct" "" "2" "00:00:01" "10.20.5.31" "82189068:" " Sending Complete"
"14" "Oct" "" "2" "00:00:01" "10.20.5.31" "82189069:" "Oct  2 00:00:01.334 AEDST: ISDN Se0/0/0:15 Q931: TX -> CALL_PROC pd = 8  callref = 0x974E "
"15" "Oct" "" "2" "00:00:01" "10.20.5.31" "82189070:" " Channel ID i = 0xA9839B "
"16" "Oct" "" "2" "00:00:01" "10.20.5.31" "82189071:" "     Exclusive, Channel 27"
"17" "Oct" "" "2" "00:00:02" "10.20.5.31" "82189072:" "Oct  2 00:00:01.350 AEDST: ISDN Se0/0/0:15 Q931: TX -> ALERTING pd = 8  callref = 0x974E "
"18" "Oct" "" "2" "00:00:02" "10.20.5.31" "82189073:" " Progress Ind i = 0x8088 - In-band info or appropriate now available "
"19" "Oct" "" "2" "00:00:02" "10.20.5.31" "82189074:" "Oct  2 00:00:01.358 AEDST: ISDN Se0/0/0:15 Q931: TX -> CONNECT pd = 8  callref = 0x974E"
"20" "Oct" "" "2" "00:00:02" "10.20.5.31" "82189075:" "Oct  2 00:00:01.382 AEDST: ISDN Se0/0/0:15 Q931: RX <- CONNECT_ACK pd = 8  callref = 0x174E"
"21" "Oct" "" "2" "00:00:19" "10.20.5.30" "81488302:" "Oct  2 00:00:18.210 AEDST: ISDN Se0/0/0:15 Q931: TX -> DISCONNECT pd = 8  callref = 0x9AC7 "
"22" "Oct" "" "2" "00:00:19" "10.20.5.30" "81488303:" " Cause i = 0x8090 - Normal call clearing"
"23" "Oct" "" "2" "00:00:19" "10.20.5.30" "81488304:" "Oct  2 00:00:18.290 AEDST: ISDN Se0/0/0:15 Q931: RX <- RELEASE pd = 8  callref = 0x1AC7"
"24" "Oct" "" "2" "00:00:19" "10.20.5.30" "81488305:" "Oct  2 00:00:18.314 AEDST: ISDN Se0/0/0:15 Q931: TX -> RELEASE_COMP pd = 8  callref = 0x9AC7"
"25" "Oct" "" "2" "00:00:21" "10.20.5.31" "82189076:" "Oct  2 00:00:21.053 AEDST: ISDN Se0/1/0:15 Q931: RX <- SETUP pd = 8  callref = 0x093A "

我希望数据集如下所示:

    "V1" "V2""V3""V4"   "V5"        "V6"        "V7"    "UniqueId"       "V8"
    "1" "Oct" "" "2" "00:00:01" "10.20.5.31" "82189056:" "0x174E" "Oct  2 00:00:01.326 AEDST: ISDN Se0/0/0:15 Q931: RX <- SETUP pd = 8  callref = 0x174E "
    "2" "Oct" "" "2" "00:00:01" "10.20.5.31" "82189057:" "0x174E" " Bearer Capability i = 0x8090A3 "
    "3" "Oct" "" "2" "00:00:01" "10.20.5.31" "82189058:" "0x174E" "      Standard = CCITT "
   ....
    "21" "Oct" "" "2" "00:00:19" "10.20.5.30" "81488302:" "0x9AC7" "Oct  2 00:00:18.210 AEDST: ISDN Se0/0/0:15 Q931: TX -> DISCONNECT pd = 8  callref = 0x9AC7 "

重新迭代:

  • 调用引用是识别此数据集的唯一方法,也称为 作为 callref 例如 0x174E (这是找到唯一调用的唯一方法 在数据集中)。 这是所请求数据框中的新列 (UniqueId)。

  • 下面的任何行也将在新列中粘贴相同的 callref id,直到它遇到另一行,该行声明相同的 callref 或另一个 call ref。

  • 每次显示 callref 时,任何可以将这些行合并为一行的人都会获得奖励积分。请注意,这可能会在几种不同的状态下发生(当包含 callref 的行还包含 TX -> CALL_PROC、TX -> ALERTING、TX -> CONNECT、RX

    李>

例如,我将第 1,2 和 3 行的 V7 列合并在一起,因为它们属于同一个 callref

    "V1" "V2""V3""V4"   "V5"        "V6"        "V7"    "UniqueId"       "V8"
    "1" "Oct" "" "2" "00:00:01" "10.20.5.31" "82189056:" "0x174E" "Oct  2 00:00:01.326 AEDST: ISDN Se0/0/0:15 Q931: RX <- SETUP pd = 8  callref = 0x174E \n Bearer Capability i = 0x8090A3 \n Standard = CCITT"

感谢任何答案。

【问题讨论】:

  • 你能把它做成一个可重现的例子,这样我就可以在 R 中使用它了吗?我很难理解你的数据集是如何布局的。请查看文档以获取可重现的示例。
  • 我现在用一个可以复制到文本文件中的示例更改了原始表,然后使用 read.table() 将其导入到 r 中。这可能不优雅,但这是我知道该怎么做。如果此更改有任何帮助,请告诉我。
  • 请使用dput(log_entry) 的输出而不是那种文本格式来编辑问题,这样我们将获得您数据的精确副本
  • 我也对您希望数据最终的显示方式有些困惑。您的输出示例与输入完全相同。
  • 对问题进行了更多清理。我已经做了一个 str_split_fixed 来制作更多的列并使数据框更加充实。

标签: r dataframe tidyr


【解决方案1】:

所以这是一个有点混乱的答案,但我已经尽力了。

您可能可以跳过我的read.fwf,因为您对str_split 做了同样的事情。我只是想以可行的格式获取数据。

我首先阅读了信息,分离出一些列

example1 <- read.fwf("ex.csv", widths = c(1, 6, 10, 10, 10, 1000), strip.white = T)

将所有内容都转换为字符串而不是因子,删除了第一行标题,并重命名了列。

example <- example1 %>%
  mutate_all(.funs = as.character) %>%
  slice(-1) %>%
  select(-1,
         Date = 2,
         Time = 3,
         IP = 4,
         id = 5,
         Description = 6)

然后我索引了 callref 出现的第一个位置,然后按这些文本块进行分组。

x <- which(grepl("callref", example$Description))

example <- example %>%
  mutate(callref = ifelse(grepl("callref", Description), 1, 0),
         group = rep(x, c(diff(c(x, x))[1:length(x)-1], nrow(.) - x[length(x)]+1))) 

example df 分组后,我总结了文本,以过去组内的描述。我认为这是您想要做的主要事情?

example2 <- example %>%
  group_by(group) %>%
  summarise(text = paste(Description, collapse = "*"))

之后我将它加入到主example df,并使用separate 来分离出一些重要信息。我们可以通过这种方式获取 RX_TX 以及 callref id。如果需要,您可以拆分任何其他重要信息,然后我建议使用 tidyr 中的 spread 函数将这些信息转换为列,以便您进一步清理以进行分析。

example3 <- example %>%
  filter(callref == 1) %>%
  left_join(example2, by = "group") %>%
  select(-Description) %>%
  rename(Description = text) %>%
  separate(Description, into = c("firstpart", "RX_TX"), sep = "Q931: ") %>%
  separate(RX_TX, into = c("RX_TX", "Info"), sep = "pd = 8") %>%
  mutate(Call_Ref = substr(gsub("callref \\= ", "", Info), 1, 8))

【讨论】:

  • 这正是我一直在寻找的!我将在我的数据集面临的许多场景中重复使用此代码。谢谢!
  • 我很高兴它对你有用!这是一件很有趣的事情。 :)
  • 我希望就如何训练以达到您能够解决此问题的水平提出一些建议。我想出了伪代码,但我无法将它们与 summarise、rep 和 group 放在一起。您会推荐什么类型的培训、资源和课程?任何提示将不胜感激。
  • 我使用数据营自学 R,同时处理工作项目和堆栈溢出。可能有 40% 的数据营和 60% 的堆栈溢出 tbh。从事项目可以教会我新技能。例如,这个问题我不得不用谷歌搜索很多东西。将文本粘贴在一起的总结不是我通常做过的事情,因为我不经常使用文本。通常使用带数字的汇总。发现差异也在谷歌上搜索堆栈溢出并玩弄它。其他的都是dplyr,我已经广泛使用了。我认为这只是新的项目和时间!
猜你喜欢
  • 2021-05-19
  • 2020-03-28
  • 2020-11-15
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 2017-01-21
  • 1970-01-01
相关资源
最近更新 更多