【发布时间】:2015-01-28 07:55:26
【问题描述】:
我无法弄清楚如何获取一个冗长文档的文本文件,并将该文本文件中的每个句子附加到一个列表中。并非所有句子都以句号结尾,因此必须考虑所有结尾字符,但也可能有一个“。”在一个句子内,所以我不能在一个句号中中断搜索。我假设这可以通过添加一个条件来解决,在句点之后应该跟一个空格,但我不知道如何设置它,所以我将文本文件中的每个句子作为一个列表放入一个列表中元素。
我正在编写的程序本质上将允许用户输入关键字搜索(键),并在找到关键字的句子之前和之后输入要返回的多个句子(值)。因此,它或多或少是一个研究助手,因此用户无需阅读大量文本文件即可找到他们想要的信息。
根据我目前所学到的知识,将句子放入列表中是最简单的方法,但我无法弄清楚它的第一部分。如果我能弄清楚这部分,其余的应该很容易组合在一起。
所以我想简而言之,
如果我有Sentence. Sentence. Sentence. Sentence. Sentence. Sentence. Sentence. Sentence. Sentence. Sentence. Sentence. Sentence.的文件
我需要一份文档内容列表,格式为:
sentence_list = [Sentence, Sentence, Sentence, Sentence, Sentence, Sentence, Sentence, Sentence, Sentence, Sentence, Sentence, Sentence]
【问题讨论】:
-
所以基本上你是在问如何在任意文本文档中拆分句子?这是一个广泛的主题,你能把它缩小一点吗?什么样的输入?任何特定的语言?
-
我不知道如何更具体 - 如果我从网上获取期刊或学术文章,将其放入文本文件(复制并粘贴到 emacs),我需要获取那些句子并将它们放在一个列表中,以便更容易访问并且我可以使用它们。
-
你能提供一个复制这个
but there could also be a '.' within a sentence的例子吗? -
您可以尝试在下面进行常规拆分重新正则表达式答案,然后通过列表检查错误拆分。然而,这可能会很慢。为了速度,我只是将其拆分,然后在搜索时合并这些行。您应该能够使用一些逻辑检查来消除绝大多数不正确的拆分
标签: python list python-3.x append text-files