【问题标题】:Evaluate escaped string评估转义字符串
【发布时间】:2011-07-08 18:48:20
【问题描述】:

我在一个文件中有一些已经转义的字符串。所以文件的内容是这样的:

Hello\nWorld. This is\tGreat.

当我读取文件时,我得到 \n 作为两个不同的字符而不是一个。

如何将转义字符串转换为非转义字符串?

【问题讨论】:

  • 它是否可以包含 C# 字符串文字可以包含的任何内容,例如 Unicode 转义序列?引号呢?

标签: c# string


【解决方案1】:

基于@deAtog 的代码,我做了一些小的补充

  • 支持\U00000000格式字符
  • 稍微简化十六进制转换

    string UnEscape(string s)
    {
        StringBuilder sb = new StringBuilder();
        Regex r = new Regex("\\\\[abfnrtv?\"'\\\\]|\\\\[0-3]?[0-7]{1,2}|\\\\u[0-9a-fA-F]{4}|\\\\U[0-9a-fA-F]{8}|.");
        MatchCollection mc = r.Matches(s, 0);
    
        foreach (Match m in mc)
        {
            if (m.Length == 1)
            {
                sb.Append(m.Value);
            }
            else
            {
                if (m.Value[1] >= '0' && m.Value[1] <= '7')
                {
                    int i = Convert.ToInt32(m.Value.Substring(1), 8);
                    sb.Append((char)i);
                }
                else if (m.Value[1] == 'u')
                {
                    int i = Convert.ToInt32(m.Value.Substring(2), 16);
                    sb.Append((char)i);
                }
                else if (m.Value[1] == 'U')
                {
                    int i = Convert.ToInt32(m.Value.Substring(2), 16);
                    sb.Append(char.ConvertFromUtf32(i));
                }
                else
                {
                    switch (m.Value[1])
                    {
                        case 'a':
                            sb.Append('\a');
                            break;
                        case 'b':
                            sb.Append('\b');
                            break;
                        case 'f':
                            sb.Append('\f');
                            break;
                        case 'n':
                            sb.Append('\n');
                            break;
                        case 'r':
                            sb.Append('\r');
                            break;
                        case 't':
                            sb.Append('\t');
                            break;
                        case 'v':
                            sb.Append('\v');
                            break;
                        default:
                            sb.Append(m.Value[1]);
                            break;
                    }
                }
            }
        }
    
        return sb.ToString();
    }
    

【讨论】:

    【解决方案2】:

    【讨论】:

    • 快速更正:那是System.Text.RegularExpressions.Regex.Unescape。请修改。
    • Regex.Unescape 在这里不适用,它仅用于对正则表达式控制字符进行转义。
    【解决方案3】:

    你可以这样做:

    string str = str.Replace(@"\n","\n");
    

    更新:

    显然这是一种解决方法,因为该场景本身是“不自然的”。 Regex.Unescape 解决方案在这里不适用,因为它旨在用于非转义正则表达式控制字符,而不是新行等。

    为了支持其他相关字符,可以编写一个这样的替换函数:

    public string ReEscapeControlCharacters(string str) {
       return str.Replace(@"\n","\n").Replace(@"\r","\r").Replace(@"\t","\t");
    }
    

    【讨论】:

    • 这是一种解决方法。 \t 和其他隐藏和控制字符呢?他应该为所有其他人这样做吗?
    • 显然这是一种解决方法...我正在更新答案并提供更多详细信息
    【解决方案4】:

    和你一样,我无法找到解决这个问题的好方法。虽然您当然可以使用 String.Replace,但此解决方案的性能和速度非常糟糕。此外,通过这种方法很难支持八进制和 Unicode 转义序列。一个更好的选择是使用一个简单的 RegEx 解析器。这是一种可以正确取消转义任何给定字符串的方法。它支持标准转义序列、八进制转义序列和 Unicode 转义序列。

    string UnEscape(string s) {
        StringBuilder sb = new StringBuilder();
        Regex r = new Regex("\\\\[abfnrtv?\"'\\\\]|\\\\[0-3]?[0-7]{1,2}|\\\\u[0-9a-fA-F]{4}|.");
        MatchCollection mc = r.Matches(s, 0);
    
        foreach (Match m in mc) {
            if (m.Length == 1) {
                sb.Append(m.Value);
            } else {
                if (m.Value[1] >= '0' && m.Value[1] <= '7') {
                    int i = 0;
    
                    for (int j = 1; j < m.Length; j++) {
                        i *= 8;
                        i += m.Value[j] - '0';
                    }
    
                    sb.Append((char)i);
                } else if (m.Value[1] == 'u') {
                    int i = 0;
    
                    for (int j = 2; j < m.Length; j++) {
                        i *= 16;
    
                        if (m.Value[j] >= '0' && m.Value[j] <= '9') {
                            i += m.Value[j] - '0';
                        } else if (m.Value[j] >= 'A' && m.Value[j] <= 'F') {
                            i += m.Value[j] - 'A' + 10;
                        } else if (m.Value[j] >= 'a' && m.Value[j] <= 'f') {
                            i += m.Value[j] - 'a' + 10;
                        }
                    }
    
                    sb.Append((char)i);
                } else {
                    switch (m.Value[1]) {
                        case 'a':
                            sb.Append('\a');
                            break;
                        case 'b':
                            sb.Append('\b');
                            break;
                        case 'f':
                            sb.Append('\f');
                            break;
                        case 'n':
                            sb.Append('\n');
                            break;
                        case 'r':
                            sb.Append('\r');
                            break;
                        case 't':
                            sb.Append('\t');
                            break;
                        case 'v':
                            sb.Append('\v');
                            break;
                        default:
                            sb.Append(m.Value[1]);
                            break;
                    }
                }
            }
        }
    
        return sb.ToString();
    }
    

    【讨论】:

    • 谢谢,这太好了,我做了一些小的改进来支持 \U00000000 格式字符并稍微简化十六进制转换。我已在下面提交了我的版本,但请随时将其合并到您的版本中。
    【解决方案5】:

    试试这个:

    String replaced = startstring.Replace(System.Environment.NewLine, desirevalue);
    

    这必须只对“\n”有效。

    【讨论】:

    • 如果它是一个解释的\n,而不是一个转义文字“slash-enn”。
    猜你喜欢
    • 1970-01-01
    • 2020-04-20
    • 2014-12-06
    • 2013-02-11
    • 2014-01-28
    • 2013-03-24
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多