【发布时间】:2021-06-06 22:33:00
【问题描述】:
假设在 R 中,我有许多由单词和数字混合组成的字符串,有一个共同点:在所有字符串中,总是有一个模式 zzzz 后跟一个空格,然后是一些未知数字。
例如:
x <- "many words, some number like 908, then zzzz 145 and some other numbers like 377 and so on"
然后,我要做的是提取 both 重复模式 zzzz 之后的数字,以及它之前的文本。
跟着@987654321@,我知道如何提取模式后面的数字了:
regmatches(x, gregexpr("zzzz \\K\\d+", x, perl=TRUE))
返回"145",上面有x 示例。我试图找到的是最有效的方式(因为我有数百万个字符串要评估)来检索模式之后的数字以及它之前的内容,这意味着返回向量:
"many words, some number like 908, then " "145"
在 R 中实现这一目标的最有效方法是什么?
【问题讨论】: