【问题标题】:Optimize getting data from a database document with Python [closed]使用 Python 优化从数据库文档中获取数据 [关闭]
【发布时间】:2022-02-05 07:37:12
【问题描述】:

我有一个 .txt 文件,其中包含超过 38,000 个术语,占用 1,350,000 行。我把它移到.json 上,突然意识到处理所有文本需要很长时间。一次只需要从数据库中获取一个值,差不多每 10 分钟一次,所以我认为将文件划分为大约 64 个其他文件会有所帮助。

这是个好主意吗?你还想出哪个?我可以做些什么来减轻访问信息的方式?在处理如此大量的数据时,有哪些一般和良好的做法可以遵循?

【问题讨论】:

  • 试试simdjson。如果你需要解码整个 json 文件,那么没有什么可做的,因为大部分时间应该由 CPython 解释器对象分配(只要你使用 CPython,这是强制性的)。如果是这样,请重新考虑是否需要在 Python 中将整个文档加载到内存中(或更快的加载时间)。另请注意,由于文本解析,很难有效地读取 Json 文档。 Json 不是为大数据存储而设计的。二进制文件格式通常效率更高(更快、更紧凑)。

标签: python json database optimization query-optimization


【解决方案1】:

我的直觉说你已经知道答案了……

【讨论】:

  • 呵呵。我猜 MongoDB 是类似于 Anki 卡片或检索小段落的正确选择,对吧?那么用户呢?使用会不会很贵?
猜你喜欢
  • 1970-01-01
  • 2013-07-01
  • 1970-01-01
  • 2013-07-16
  • 2013-02-21
  • 2018-12-16
  • 1970-01-01
  • 1970-01-01
  • 2014-06-10
相关资源
最近更新 更多