【发布时间】:2020-04-13 05:33:46
【问题描述】:
我正在尝试从一个小型(约 13,000 obs)医疗保健数据集中的一些字符串中提取日期,以进行文本分析。
名为Current Tracking Events的示例数据字段:
06/12/2019 Day 2: OPA with JK/MD. CT colonoscopy requested. | 17/12/2019 Day 13: CT colonoscopy:
通常有比这更多的数据由额外的管道分隔 |
我正在使用以下代码:
extracted_data <-
original data %>%
unnest_tokens(comment, `Current Tracking Events`, token = "regex", pattern = "[|]") %>% # to first divide the data by the piped sections
mutate(comment_date = str_detect(comment, pattern = "\\d+/\\d+/\\d+")) # extract the date at the start of the comment
这适用于前约 3,000 次观察,但随后失败并返回 NA。当我提取一些失败的特定观察集时,它会再次起作用。我不知道我可以运行哪些其他测试来理解为什么它没有提取我需要的信息。任何人都可以解释一下吗?我已经通过 Google 和文档进行了搜索,但看不到可能出了什么问题。
数据集已使用 odbc 包从 microsoft sql server 导入到 r。
【问题讨论】: