【问题标题】:Design pattern for handling large datasets for machine learning为机器学习处理大型数据集的设计模式
【发布时间】:2017-08-17 07:26:58
【问题描述】:

我目前正在尝试从网站上抓取数据并从中构建一个大型(并且可能会随着时间增长)数据集。我想知道在处理、保存和加载大型数据集时是否有任何好的做法可以采用。

更具体地说,当我要保存的数据集太大而无法存储在RAM中时,我该怎么办,然后一次性写入磁盘;一次写一个数据点效率太低了?有没有比一次写入一个中等大小的文件更聪明的方法?

感谢您的宝贵时间!

【问题讨论】:

  • 不要重新发明轮子,只需使用任何标准数据库 - MySQL、Postgress、Oracle、w/e。让数据库引擎担心 [in] 效率。

标签: python design-patterns


【解决方案1】:

当然,使用数据库。

您可能应该看看 MongoDB 或 elasticSearch,因为您存储的似乎是文档而不是关系数据。

https://www.mongodb.com/

https://www.elastic.co/

【讨论】:

    猜你喜欢
    • 1970-01-01
    • 2018-08-18
    • 1970-01-01
    • 2015-06-07
    • 2019-03-21
    • 2016-09-19
    • 2020-06-15
    • 2017-05-16
    • 2019-05-06
    相关资源
    最近更新 更多