【发布时间】:2011-12-20 23:05:16
【问题描述】:
假设我有一个大得离谱的文本文件。我认为我的文件不会超过 ~500mb,但为了可扩展性和我自己的好奇心,假设它大约是几个 gig。
我的最终目标是将其映射到一组句子(由“?”、“!”、“。”分隔,并且出于所有意图和目的,使用“;”)并将每个句子映射到一组单词。然后我打算使用 numpy 进行一些统计分析。
最可扩展的方式是什么?
PS:我曾想过将文件重写为每行一个句子,但在尝试将文件加载到内存时遇到了问题。我知道一种解决方案,您可以读取一个文件中的数据块,操作它们,然后将它们写入另一个文件,但这对于磁盘内存来说似乎效率低下。我知道,现在大多数人不会担心使用 10gig 的暂存空间,但似乎应该有一种直接编辑文件的方法。
【问题讨论】:
-
出于所有密集目的或出于所有意图和目的?
-
为什么不使用数据库,比如 sqllite?
-
您为什么不直接将文件扫描为流并保持计数呢?解析不会很复杂吧?
-
说实话,我不知道如何使用sqllite。然而,我对 python 很满意。
-
你真的需要分句,还是只分词?