【发布时间】:2017-12-16 19:53:46
【问题描述】:
我从一个文本文件中提取了一行,结果它生成了 3 克的一行,但在行尾它的输出是 2 克。 例如输入行是 cswisceduwwt 输出是
csw
swi
wis
isc
sce
ced
edu
dup
upa
par
ara
rad
ady
dyn
yn
在行尾,它生成 2 克(2 个字符)。最后一个克是“yn”,我认为它增加了空间。我不需要“yn”如何从每行中删除最后一个有 2 个字符的克? 代码如下
def extract_n_grams(line):
ngram = ngrams(line, 3)
for item in ngram:
result=item[0]+item[1]+item[2]
print(result)
with open('C:/Users/Dania/Desktop/MS 2nd sem/preprocessed.txt') as corpus:
for line in corpus:
extract_n_grams(line)
【问题讨论】: