【问题标题】:Data Remodelling and transformation mysql to hdfs and mongodb数据重构和转换mysql到hdfs和mongodb
【发布时间】:2019-04-05 18:50:41
【问题描述】:

我们正面临数据迁移问题。我们有两张负载很重的桌子。我们过去常常进行连接并从两个表中实时获取聚合数据。由于由于大小增加,我们希望将其迁移到 mongodb 中,通过重构具有平面数据库布局来克服连接。我研究了很多,但我无法弄清楚确切的工具或框架。 Sqoop 和 Flume 直接将表从一个系统迁移到另一个系统,但不进行重构。我无法根据我的需要确定是 Spring XD 还是 apache nifi 转换。

伪步骤如下

第 1 步(从第一个系统获取)

1) var a = select id, name, age from info where age > 10;

第 2 步(从第一个系统获取)

2) var b = 选择地址,收入来自professional_detail where id = a.id;

第 3 步(插入第二个系统)

3) 将值 (a.id, a,age,a.name, b.income, b.address) 插入到 aggregate_table (id, age, name, income, address) 中

哪一个框架或工具最适合这个?我们只想做 sql 查询、bash 命令和 java 代码。没有其他语言

【问题讨论】:

  • 您可以使用 ETL 工具来做到这一点。请尝试使用一些可用的 ETL 工具,例如 Talend。 talend.com/download/talend-open-studio
  • @MaheshMadushanka pentaho 水壶工作是否符合标准?
  • 是的,你可以使用 pentaho 水壶作业。它是另一个 ETL 工具。
  • 当你完成后,让我们知道由于“平面数据库布局来克服连接”,它会快多少(或慢多少)。 (公平地说,请包括显示索引和选择的架构。)

标签: mysql data-modeling data-migration bigdata


【解决方案1】:

根据问题和 cmets,可以肯定地说您需要 ETL 解决方案。

当您提到一些工具时,您似乎正在关注 Hadoop 生态系统,在这个领域,Spark 似乎最适合您的要求。

【讨论】:

    猜你喜欢
    • 1970-01-01
    • 2017-10-31
    • 1970-01-01
    • 1970-01-01
    • 2017-03-28
    • 2018-01-25
    • 1970-01-01
    • 2012-07-20
    • 2019-10-11
    相关资源
    最近更新 更多