【发布时间】:2013-03-27 14:29:37
【问题描述】:
我有一个包含多个文本文件的文件夹,我需要使用多个替换列表进行处理和格式化,如下所示:
old string1~new string1
old string2~new string2
etc~blah
我从多个文本文件的每一行的替换列表中运行每个替换对。现在我有一组 python 脚本来执行这个操作。我想知道的是,如果我切换到 sed 或 awk,它会使代码更简单、更易于维护吗?它会是一个更好的解决方案还是我应该更好地改进我的 Python 代码?我问是因为传入的文本文件定期出现,并且通常与以前有一些不同的结构,比如错误、拼写错误、多个空格,因为这些文件是由人类创建的。所以我必须不断调整我的代码和替换列表以使其正常工作。 谢谢。
【问题讨论】:
-
很难说没有看到你的 Python 代码,所以我们有一个更好的主意,如果它是一个瓶颈......
-
您在问题中使用了“字符串”一词,但您接受的解决方案使用正则表达式,那么它在上面“~”的左侧是字符串还是正则表达式?跨度>
-
是的,很抱歉造成混淆,我使用正则表达式,而那些带有~的字符串实际上是正则表达式。
标签: python regex sed awk text-processing