【发布时间】:2022-02-05 07:37:12
【问题描述】:
我有一个 .txt 文件,其中包含超过 38,000 个术语,占用 1,350,000 行。我把它移到.json 上,突然意识到处理所有文本需要很长时间。一次只需要从数据库中获取一个值,差不多每 10 分钟一次,所以我认为将文件划分为大约 64 个其他文件会有所帮助。
这是个好主意吗?你还想出哪个?我可以做些什么来减轻访问信息的方式?在处理如此大量的数据时,有哪些一般和良好的做法可以遵循?
【问题讨论】:
-
试试simdjson。如果你需要解码整个 json 文件,那么没有什么可做的,因为大部分时间应该由 CPython 解释器对象分配(只要你使用 CPython,这是强制性的)。如果是这样,请重新考虑是否需要在 Python 中将整个文档加载到内存中(或更快的加载时间)。另请注意,由于文本解析,很难有效地读取 Json 文档。 Json 不是为大数据存储而设计的。二进制文件格式通常效率更高(更快、更紧凑)。
标签: python json database optimization query-optimization