【问题标题】:How to remove leading and trailing non-alphanumeric characters of a certain string in python using regex?如何使用正则表达式删除python中某个字符串的前导和尾随非字母数字字符?
【发布时间】:2021-08-02 09:23:41
【问题描述】:

如何删除给定字符串中某个子字符串前后的前导和尾随非字母字符?请参阅下面的示例

input_string = m#12$my#tr!#$g%

output_string = m12my#tr!g

在这种情况下,子字符串是my#tr!

给定输入字符串如何得到输出字符串?

我在下面的尝试删除了所有前导字符(包括字母数字)。请参阅下面的代码 sn-p)。我尝试修改 \W+ 而不是 .+,但没有成功。

import re
input_string = "m#12$my#tr#$%"
output_string = re.sub(r'.+?(?=my#tr!)', '', "m#12$my#tr!#$g%")

感谢任何关于我如何为此目的使用正则表达式模式的想法。

【问题讨论】:

  • 为什么保留tr后的!

标签: python regex non-alphanumeric


【解决方案1】:

这样做的一种方法是将字符串拆分为所需的子字符串,替换第一部分和最后一部分中的非字母数字字符,然后重新组合字符串:

import re

input_string = "m#12$my#tr!#$g%"
mid = 'my#tr!'
first, last = input_string.split(mid)
first = re.sub('[^a-z0-9]', '', first)
last = re.sub('[^a-z0-9]', '', last)

output_string = first + mid + last
print(output_string)

输出:

m12my#tr!g

如果您使用 PyPi 中的 regex 模块,您可以利用可变长度的lookbehinds 并替换目标字符串之前或之后的任何非字母数字字符:

import regex

input_string = "m#12$my#tr!#$g%"
mid = 'my#tr!'
output_string = regex.sub(rf'[^a-z0-9](?=.*{mid})|(?<={mid}.*)[^a-z0-9]', '', input_string)
# 'm12my#tr!g'

请注意,如果mid 包含正则表达式的特殊字符(例如. [ { $ ^ 等),您应该在使用前对其进行转义,即

mid = 'my#tr!'
mid = regex.escape(mid)

如果您根本不想使用正则表达式,您可以手动将非字母数字字符从第一部分和最后一部分中去除。例如:

import string

input_string = "m#12$my#tr!#$g%"
mid = 'my#tr!'
first, last = input_string.split(mid)
first = ''.join(c for c in first if c in string.ascii_letters + string.digits)
last = ''.join(c for c in last if c in string.ascii_letters + string.digits)
output_string = first + mid + last

【讨论】:

  • 有没有办法在 Python 中做到这一点而不使用正则表达式?像 strip() 函数一样有效吗?
  • @Mad 您可以手动从前面/最后部分剥离字符。查看我的编辑
猜你喜欢
  • 1970-01-01
  • 2012-01-10
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 2016-12-02
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
相关资源
最近更新 更多