逻辑
我建议采用以下结合正则表达式和通用字符串处理逻辑的方法:
- 使用
preg_match 和适当的正则表达式来匹配整个文本块的第一次出现,从$terms 数组中的关键字开始,直到与该术语相关的最后一个数字(+ 可选部分字母)
- 获得匹配后,创建一个包含输入字符串、匹配值和后处理匹配的数组
- 可以通过删除连字符数字之间的空格并在数字与
+、& 或, 字符连接的情况下重建数字范围来完成后处理。这需要一个多步骤操作:1)匹配前一个整体匹配中的连字符分隔的子字符串并修剪掉不必要的零和空格,2)将数字块拆分为单独的项目并将它们传递给将生成数字的单独函数范围
-
buildNumChain($arr) 函数将创建数字范围,如果数字后面有字母,则将其转换为 section X 后缀。
解决方案
你可以使用
$strs = ['c0', 'c0-3', 'c0+3', 'c0 & 9', 'c0001, 2, 03', 'c01-03', 'c1.0 - 2.0', 'chapter 2A Hello', 'chapter 2AHello', 'chapter 10.4c', 'chapter 2B', 'episode 23.000 & 00024', 'episode 23 & 24', 'e23 & 24', 'text c25.6 text', '001 & 2 & 5 & 8-20 & 100 text chapter 25.6 text 98', 'hello 23 & 24', 'ep 1 - 2', 'chapter 1 - chapter 2', 'text chapter 25.6 text', 'text chapters 23, 24, 25 text','text chapter 23, 25 text', 'text chapter 23 & 24 & 25 text','text c25.5-30 text', 'text c99-c102 text', 'text chapter 1 - 3 text', '33 text chapter 1, 2 text 3','text chapters 23, 24, 25, 29, 31, 32 text', 'c19 & c20', 'chapter 25.6 & chapter 29', 'chapter 25+c26', 'chapter 25 + 26 + 27'];
$terms = ['episode', 'chapter', 'ch', 'ep', 'c', 'e', ''];
usort($terms, function($a, $b) {
return strlen($b) - strlen($a);
});
$chapter_main_rx = "\b(?|" . implode("|", array_map(function ($term) {
return strlen($term) > 0 ? "(" . substr($term, 0, 1) . ")(" . substr($term, 1) . "s?)": "()()" ;},
$terms)) . ")\s*";
$chapter_aux_rx = "\b(?:" . implode("|", array_map(function ($term) {
return strlen($term) > 0 ? substr($term, 0, 1) . "(?:" . substr($term, 1) . "s?)": "" ;},
$terms)) . ")\s*";
$reg = "~$chapter_main_rx((\d+(?:\.\d+)?(?:[A-Z]\b)?)(?:\s*(?:[,&+-]|and)\s*(?:$chapter_aux_rx)?(?4))*)~ui";
foreach ($strs as $s) {
if (preg_match($reg, $s, $m)) {
$p3 = preg_replace_callback(
"~(\d*(?:\.\d+)?)([A-Z]?)\s*-\s*(?:$chapter_aux_rx)?|(\d+(?:\.\d+)?(?:[A-Z]\b)?)(?:\s*(?:[,&+]|and)\s*(?:$chapter_aux_rx)?(?1))*~ui", function($x) use ($chapter_aux_rx) {
return (isset($x[3]) && strlen($x[3])) ? buildNumChain(preg_split("~\s*(?:[,&+]|and)\s*(?:$chapter_aux_rx)?~ui", $x[0]))
: ((isset($x[1]) && strlen($x[1])) ? ($x[1] + 0) : "") . ((isset($x[2]) && strlen($x[2])) ? ord(strtolower($x[2])) - 96 : "") . "-";
}, $m[3]);
print_r(["original" => $s, "found_match" => trim($m[0]), "converted" => $m[1] . $p3]);
echo "\n";
} else {
echo "No match for '$s'!\n";
}
}
function buildNumChain($arr) {
$ret = "";
$rngnum = "";
for ($i=0; $i < count($arr); $i++) {
$val = $arr[$i];
$part = "";
if (preg_match('~^(\d+(?:\.\d+)?)([A-Z]?)$~i', $val, $ms)) {
$val = $ms[1];
if (!empty($ms[2])) {
$part = ' part ' . (ord(strtolower($ms[2])) - 96);
}
}
$val = $val + 0;
if (($i < count($arr) - 1) && $val == ($arr[$i+1] + 0) - 1) {
if (empty($rngnum)) {
$ret .= ($i == 0 ? "" : " & ") . $val;
}
$rngnum = $val;
} else if (!empty($rngnum) || $i == count($arr)) {
$ret .= '-' . $val;
$rngnum = "";
} else {
$ret .= ($i == 0 ? "" : " & ") . $val . $part;
}
}
return $ret;
}
请参阅PHP demo。
要点
- 将
c 或chapter/chapters 与后面的数字匹配,仅捕获c 和数字
- 找到匹配项后,处理包含数字序列的组 2
- 所有
<number>-c?<number> 子字符串都应去除空格和c 在数字之前/之间和之间
- 所有
,/& 分隔的数字都应使用buildNumChain 进行后处理,该buildNumChain 生成连续数字的范围(假定为整数)。
主正则表达式看起来像$terms = ['episode', 'chapter', 'ch', 'ep', 'c', 'e', '']:
'~(?|(e)(pisodes?)|(c)(hapters?)|(c)(hs?)|(e)(ps?)|(c)(s?)|(e)(s?)|()())\s*((\d+(?:\.\d+)?(?:[A-Z]\b)?)(?:\s*(?:[,&+-]|and)\s*(?:(?:e(?:pisodes?)|c(?:hapters?)|c(?:hs?)|e(?:ps?)|c(?:s?)|e(?:s?)|)\s*)?(?4))*)~ui'
请参阅regex demo。
模式详情
-
(?|(e)(pisodes?)|(c)(hapters?)|(c)(hs?)|(e)(ps?)|(c)(s?)|(e)(s?)|()()) - 一个分支重置组,它捕获搜索词的第一个字母并将该词的其余部分捕获到强制组 2。如果有一个空词,则添加 ()() 以确保在group 包含相同数量的组
-
\s* - 0+ 个空格
-
((\d+(?:\.\d+)?(?:[A-Z]\b)?)(?:\s*(?:[,&+-]|and)\s*c?(?3))*) - 第 2 组:
-
(\d+(?:\.\d+)?(?:[A-Z]\b)?) - 第 3 组:1+ 位,后跟. 的可选序列,1+ 位数字,然后是可选的 ASCII 字母,后跟非单词字符或字符串结尾(注意不区分大小写的修饰符将使[A-Z] 也匹配小写ASCII 字母)
-
(?:\s*(?:[,&+-]|and)\s*(?:(?:e(?:pisodes?)|c(?:hapters?)|c(?:hs?)|e(?:ps?)|c(?:s?)|e(?:s?)|)\s*)?(?4))* - 零个或多个序列
-
\s*(?:[,&+-]|and)\s* - 一个 ,、&、+、- 或 and,包含可选的 0+ 个空格
-
(?:e(?:pisodes?)|c(?:hapters?)|c(?:hs?)|e(?:ps?)|c(?:s?)|e(?:s?)|) - 添加可选复数结尾的任何术语s
-
(?4) - 第 4 组模式递归/重复
当正则表达式匹配时,Group 1 的值为c,因此它将是结果的第一部分。那么,
"~(\d*(?:\.\d+)?)([A-Z]?)\s*-\s*(?:$chapter_aux_rx)?|(\d+(?:\.\d+)?(?:[A-Z]\b)?)(?:\s*(?:[,&+]|and)\s*(?:$chapter_aux_rx)?(?1))*~ui"
在preg_replace_callback 中使用,以删除-(如果有)和术语(如果有)之间的空格,后面跟0+ 个空格字符,如果第1 组匹配,则匹配以
"~\s*(?:[,&+]|and)\s*(?:$chapter_aux_rx)?~ui"
正则表达式(它匹配 &、,、+ 或 and 在可选的 0+ 空格后跟 0+ 空格,然后是可选字符串,术语后跟 0+ 空格)并且数组是传递给构建结果字符串的buildNumChain 函数。