【发布时间】:2021-07-04 01:09:20
【问题描述】:
我有 1000 行字符串。我想根据python中的条件从字符串中提取单词。
例如:'1.雪碧 (9x)::=2。咖啡::= 奶油 (10x)::= 糖 (10x)::= 小::=3。一包黑糖 (6x)'
输出应为:
-> 雪碧、咖啡、黑糖包。
就像我想提取数字 1.,2.,3 之后的单词一样。并删除所有前后的特殊字符。
【问题讨论】:
标签: python regex string nlp data-science
我有 1000 行字符串。我想根据python中的条件从字符串中提取单词。
例如:'1.雪碧 (9x)::=2。咖啡::= 奶油 (10x)::= 糖 (10x)::= 小::=3。一包黑糖 (6x)'
输出应为:
-> 雪碧、咖啡、黑糖包。
就像我想提取数字 1.,2.,3 之后的单词一样。并删除所有前后的特殊字符。
【问题讨论】:
标签: python regex string nlp data-science
我们可以在这里使用re.findall:
inp = '1. Sprite (9x)::=2. Coffee::= Cream (10x)::= Sugar (10x)::= Small::=3. Packet of Black Sugar (6x)'
matches = re.findall(r'\d+\. (\w+(?: \w+)*)', inp)
print(matches) # ['Sprite', 'Coffee', 'Packet of Black Sugar']
【讨论】: