【发布时间】:2012-10-17 20:26:10
【问题描述】:
给定一个非常大的文本文件,我想删除文件中只出现一次的所有单词。有什么简单有效的方法吗?
最好的问候,
【问题讨论】:
-
文件是否需要保持有序?列表排序了吗?
-
nltk 字数 -> 获取所有出现一次的单词 -> 使用正则表达式删除
-
文件可能是GB大小,行数可能是几百万。输出文件不应包含频率为 1 的任何单词。换句话说,这些稀有词只是从文件中删除,其他一切都将保持不变。最好的问候,
标签: python linux file unix words