【发布时间】:2013-06-15 13:56:40
【问题描述】:
我需要从文本中获取前 N 个句子,其中句子的最后一个字符可以是句点、冒号或分号。例如,给定以下文本:
Lorem ipsum, dolor sit amet. consectetur adipisicing elit; sed do eiusmod tempor.
incididunt ut labore: et dolore magna aliqua. Ut enim ad. minim veniam.
前 4 句话是,
Lorem ipsum, dolor sit amet. consectetur adipisicing elit; sed do eiusmod tempor.
incididunt ut labore:
目前,我的代码正在使用.、: 和; 作为分隔符拆分字符串,然后加入结果。
import re
sentences = re.split('\. |: |;', text)
summary = ' '.join(sentences[:4])
但它会从结果中删除分隔符。我对正则表达式或基本字符串操作持开放态度。
【问题讨论】:
-
你会如何处理:例如,现在是凌晨 5 点。早上在这里和我的 C.D.不是很好,等等等等;你还好吗。这个??
-
@Ben 是的,有“特殊情况”,结果是可以接受的。它不一定是完美的。