【发布时间】:2023-04-06 15:01:01
【问题描述】:
我们是学生,试图处理大约 1.4 亿条记录的数据,并尝试运行一些机器学习算法。我们是整个云解决方案和 mahout 实现的新手。目前我们已经在 postgresql 数据库中设置了它们,但是当前的实现没有扩展,并且经过多次性能调整后读/写操作似乎非常慢。因此我们计划选择基于云的服务。
我们已经探索了一些可能的替代方案。
- 基于亚马逊云的服务(Mahout 实现)
- Picloud 与 scikits 学习(我们计划将 HDF5 格式与 NumPy 一起使用)
- 如果有的话,请推荐任何其他替代品。
这里有以下问题
- 哪种方法可以为我们带来更好的结果(周转时间)并且具有成本效益?请务必提及我们存在的任何其他替代方案。
- 如果我们设置亚马逊服务,我们应该如何拥有数据格式?如果我们使用 dynamodb,成本会飙升吗?
谢谢
【问题讨论】:
标签: numpy hadoop amazon-ec2 machine-learning mahout