【发布时间】:2019-02-15 03:26:55
【问题描述】:
好的,我简化我的问题:
我有一个列表(文档),其中包含一些列表(句子)作为str。赞a = [['Sent1 from first doc!','Sent2 from first doc.'],['Sent1 from 2nd doc.','Sent2 from 2nd doc.']]
现在我尝试将每个句子分成一个单词列表。所以我可能会有一个包含一个列表(句子)的第一个(文档)列表,其中每个包含一个列表(该句子中的单词)作为str)。
不幸的是,我的代码生成了一个包含每个单词的(句子)列表。因此,我忘记了每个句子来自哪个文档。
我的代码如下所示:
sentcs = []
for i in range(len(a)):
for p in range(len(a[i])):
spr = re.findall(r'[A-Z]?[^A-Z\s]+|[A-Z]+', a[i][p])
sentcs.append(spr)
但这不是我想要的..我想要一个列表列表..或者是编写这样的程序的坏习惯?
【问题讨论】:
标签: python regex python-3.x list nltk