【问题标题】:Validating Python list indexing syntax with ECMAScript regex使用 ECMAScript 正则表达式验证 Python 列表索引语法
【发布时间】:2017-11-22 07:11:10
【问题描述】:

我正在编写一个 C++ 代码,它将字符串作为输入并检查该字符串是否具有有效的 Python 列表索引语法。例如:

a[0]a[:]a[::]a[0:]a[-1::]a[ 2 : 1:2]a[: -1:]a[::- 1]a[1:10:2]等。

到目前为止,我已经得到了以下正则表达式:

^[a-zA-Z_][a-zA-Z0-9_]*\[([ ]*-?[ ]*[0-9]+[ ]*)*:?([ ]*-?[ ]*[0-9]+[ ]*)*:?([ ]*-?[ ]*[0-9]+[ ]*)*\]$

但是,我觉得它太长了,我想知道是否有更好的方法来做到这一点。此外,上面的正则表达式将匹配a[],这是不可取的。我刚刚开始尝试正则表达式,我的知识有限。所以我的问题是:

  • 是构造正则表达式以验证 Python 列表索引的更好方法吗?
  • 我希望正则表达式在a[] 上失败。我该怎么做?

我正在使用默认具有 ECMAScript 语法的 C++ 11 正则表达式库。

谢谢。

【问题讨论】:

  • 如果你想要的只是语法有效,那么你就无法知道它是否是一个列表。 a['stuff', f(1, 2, 3), a+b.blah] 这样的东西在语法上是有效的。
  • 好吧,它看起来不会太长,但您可以稍微缩短它并添加一个前瞻来限制空括号 - R"(^[_a-zA-Z]\w*\[(?! *\]) *-? *\d*(?: *: *-? *\d*){0,2} *\])"

标签: python c++ regex c++11


【解决方案1】:

你可以使用

^[_a-zA-Z]\w*\[(?! *\]) *-? *\d*(?: *: *-? *\d*){0,2} *\]$

请参阅regex demo。空格可以替换为[[:blank:]][ \t] 以匹配水平空格。

模式详情

  • ^ - 字符串开头
  • [_a-zA-Z] - _ 或 ASCII 字母
  • \w* - ASCII 字母/数字/_
  • \[ - 一个[
  • (?! *\]) - ] 后面不能有 0+ 个空格
  • *-? * - 0+ 个空格,可选-,0+ 个空格
  • \d*
  • (?: *: *-? *\d*){0,2} - 零、一或两次出现:
    • *: *-? * - 0+ 个空格,可选 -,0+ 个空格
    • \d* - 0+ 位
  • *] - 0+ 个空格和 ]
  • $ - 字符串结束。

查看C++ demo(注意regex_match^$ 变得多余,可以省略):

#include <iostream>
#include <regex>
using namespace std;

int main() {
    std::vector<std::string> strings;
    strings.push_back("a[0]");
    strings.push_back("a[:]");
    strings.push_back("a[::]");
    strings.push_back("a[0:]");
    strings.push_back("a[-1::]");
    strings.push_back("a[  2 :  1:2]");
    strings.push_back("a[:  -1:]");
    strings.push_back("a[::-  1]");
    strings.push_back("a[1:10:2]");
    strings.push_back("a[]");

    std::regex rex1(R"([_a-zA-Z]\w*\[(?! *\]) *-? *\d*(?: *: *-? *\d*){0,2} *\])");
    for (auto s : strings)
    {
        std::cout << "Next string: " << s;
        if (regex_match(s, rex1)) {
            std::cout << "<= Matched" << std::endl;
        } else {
            std::cout << "<= Not Matched" << std::endl;
        }
    }
    return 0;
}

输出:

Next string: a[0]<= Matched
Next string: a[:]<= Matched
Next string: a[::]<= Matched
Next string: a[0:]<= Matched
Next string: a[-1::]<= Matched
Next string: a[  2 :  1:2]<= Matched
Next string: a[:  -1:]<= Matched
Next string: a[::-  1]<= Matched
Next string: a[1:10:2]<= Matched
Next string: a[]<= Not Matched

【讨论】:

  • 你好,我的朋友。很好的解释!我想知道您是否也可以修改建议的解决方案以不匹配a[-] 和以零开头的数字,例如a[01]a[2:003]a[02:-001:0003] 等。谢谢。
  • PS:我会接受你的回答,不管你是否解决了这个额外的请求,如果很快没有更好的答案出现。
  • @AstrOne 很高兴提供帮助,只是为了解释一下:(?![ -]*\]) 匹配失败,如果在[ 之后,只有空格或连字符直到](?!0+[1-9]) 负前瞻在当前位置后跟一个从19 的数字后跟1 个或多个0 字符的所有匹配失败(即,所有\d* 都不能匹配以0 开头的数字)。
猜你喜欢
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 2012-02-29
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
相关资源
最近更新 更多