【发布时间】:2021-04-08 11:32:00
【问题描述】:
我有一段句子,我使用nltk 的sent_tokenize 将其标记为单独的句子。但是,有些句子紧跟在前一句的句号 . 之后。因此sent_tokenize 似乎无法区分这两个句子。例如:
"Today I went for ice-cream.It was good." 当用sent_tokenize 解析时仍然给出"Today I went for ice-cream.It was good."。另一方面,"Today I went for ice-cream. It was good." 与 sent_tokenize 解析时会给出 "Today I went for ice-cream." 和 "It was good."
谢谢!
【问题讨论】:
-
我很确定 nltk 这样工作是有充分理由的。您想要的将标记诸如“美国是一个国家”之类的句子。分为三个句子:“The U”、“S”和“is a country”。除非您有充分的理由这样做,否则我建议您不要这样做。