【发布时间】:2011-04-06 01:26:25
【问题描述】:
最初,我只需要处理 1.5[TB] 的数据。由于我只需要快速写入/读取(无需任何 SQL),因此我设计了自己的平面二进制文件格式(使用 python 实现)并轻松(愉快地)保存我的数据并在一台机器上对其进行操作。当然,出于备份目的,我添加了 2 台机器用作精确镜像(使用 rsync)。
目前,我的需求不断增长,因此需要构建一个能够成功扩展到 20[TB](甚至更多)数据的解决方案。 我很乐意继续使用我的平面文件格式进行存储。它快速、可靠,可以满足我的一切需求。
我关心的是复制、数据一致性等(显然,数据必须在网络上进行分发——all data 不能存储在one machine 上)。
是否有任何ready-made 解决方案 (Linux / python based) 可以让我继续使用我的文件格式进行存储,但可以处理NoSql 解决方案通常提供的其他组件? (数据一致性/可用性/易于复制)?
基本上,我只想确保我的二进制文件在整个网络中保持一致。我正在使用一个由 60 台双核机器组成的网络(每台机器都有 1GB RAM 和 1.5TB disk)
【问题讨论】:
标签: python linux distributed