【问题标题】:Extracting dates from long filename从长文件名中提取日期
【发布时间】:2017-08-11 03:11:04
【问题描述】:

我已阅读此处有关从文件名中提取日期(或不同部分)的其他一些问题,但我似乎无法获得任何其他答案来处理我的文件名。 我有一个目录中超过 15,000 个文件名的列表,我需要从文件名中提取日期,这样我就可以找出我缺少哪些日期(我总共应该有 15,706 个,但在某些目录中。我只有 ~15,600 )

这是一个例子

maxTemps <- list.files("./Daily/Daily_TMax/", recursive = TRUE, pattern = ".asc$", full.names = FALSE)
length(maxTemps)
[1] 15697

head(maxTemps)
[1] "1970/eMAST_ANUClimate_day_tmax_v1m0_19700101.asc" "1970/eMAST_ANUClimate_day_tmax_v1m0_19700102.asc"
[3] "1970/eMAST_ANUClimate_day_tmax_v1m0_19700103.asc" "1970/eMAST_ANUClimate_day_tmax_v1m0_19700104.asc"
[5] "1970/eMAST_ANUClimate_day_tmax_v1m0_19700105.asc" "1970/eMAST_ANUClimate_day_tmax_v1m0_19700106.asc"

tail(maxTemps)
[1] "2012/eMAST_ANUClimate_day_tmax_v1m0_20121226.asc" "2012/eMAST_ANUClimate_day_tmax_v1m0_20121227.asc"
[3] "2012/eMAST_ANUClimate_day_tmax_v1m0_20121228.asc" "2012/eMAST_ANUClimate_day_tmax_v1m0_20121229.asc"
[5] "2012/eMAST_ANUClimate_day_tmax_v1m0_20121230.asc" "2012/eMAST_ANUClimate_day_tmax_v1m0_20121231.asc"

我已经能够使用以下代码来获取年份(基于文件夹)

regmatches(maxTemp, regexpr("[0-9]{4}", maxTemp))

我想我可以使用它,与 invert = TRUE 一起返回其余字符串,因为如果我尝试在 regexpr 中包含文件名的常量部分,我会收到错误

maxTempsFiles <- regmatches(maxTemp, regexpr("[0-9]{4}\/(eMAST_ANUClimate_day_tmax_v1m0_)", maxTemp), invert = TRUE)
Error: '\/' is an unrecognized escape in character string starting ""[0-9]{4}\/"

所以我想我可以使用有效的代码,然后将文件名的常量部分子集化,留下日期,然后我只需要删除带有sub 的 .asc,但这会返回一些混乱文字

maxTempsFiles <- regmatches(maxTemp, regexpr("[0-9]{4}", maxTemp), invert = TRUE)
maxTempsFiles <- sub(x = maxTempsFiles, pattern = "/eMAST_ANUClimate_day_tmax_v1m0_", replacement = "")
maxTempsFiles <- sub(x = maxTempsFiles, pattern = ".asc", replacement = "")
head(maxTempsFiles)
[1] "c(\"\", \"19700101\")" "c(\"\", \"19700102\")" "c(\"\", \"19700103\")" "c(\"\", \"19700104\")" "c(\"\", \"19700105\")"
[6] "c(\"\", \"19700106\")"

文件中总是有/eMAST_ANUClimate_day_prec_v1m0_,它只是第一个更改的文件夹,文件名的末尾19700101.asc一直到20121231.asc

如果有人可以提供一些关于如何最好地做到这一点的代码/建议,那就太好了。

【问题讨论】:

  • gsub("(^.*_)(\\d+)\\.asc", "\\2", x) 怎么样?
  • 感谢@RomanLuštrik 的快速答复。我以前对gsubsubregexpr 等没有太多经验。您能否将您的评论放在答案@RomanLuštrik 中,以准确解释它的作用?我正在尝试了解它是如何工作的。

标签: r regex extract filenames


【解决方案1】:

这是使用组搜索字符串的部分匹配项的简单搜索 - 并在组中返回所需的匹配项。

gsub("(^.*_)(\\d+)\\.asc$", "\\2", x)

正则表达式解释:

group 1:
  (^.*_) - match beginning of string (^) and then any character until _ is found
group 2:
  (\\d+) - find any digit, several times (+)
no group:
  \\.asc$ - at last, find .asc, which should be the end of the string ($)

gsub 中的replacement 参数用于替换字符串的匹配部分,或者返回所需的组。对于第 2 组,您需要\\2subgsub 之间的区别在于前者将只返回第一个匹配的模式,而 gsub 将适用于整个向量。

【讨论】:

    猜你喜欢
    • 1970-01-01
    • 1970-01-01
    • 2022-11-18
    • 1970-01-01
    • 2021-03-26
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多