【发布时间】:2019-06-01 20:54:28
【问题描述】:
我是一所大型州立大学的一名正在升职的高级 CS 专业学生,并且在一家大型上市技术公司的数据科学部门担任实习生。我在学校学习过数据结构和算法(地图、树、图、排序算法、搜索算法、MapReduce 等),并且通过个人项目使用 MySQL 和 SQL 查询获得了一些经验。
我的实习项目是创建一个仪表板,用于显示从 Hadoop 数据库收集的分析数据。我很难理解这些数据的结构和查询方式。我很确定 Hadoop 中的所有数据都来自运行其平台的生产 Oracle 关系数据库。 我想我的核心问题是为什么需要 Hadoop 和分布式处理来从已经采用结构化格式的数据库中收集分析?存储在 Hadoop 中的数据是什么样的?是否有 MySQL 之类的表或 MongoDB 之类的 JSON 文档? 我将通过 Druid 查询 Hadoop,但我不确定这个数据库中有什么。
和我一起工作的工程师都非常擅长向我解释事情,尤其是关于他们具体实施的问题,但他们只有一定的时间来帮助实习生,我想主动学习其中一些是我自己的。
作为旁注,令人难以置信的是,它在学校项目上的工作与在拥有数百万活跃用户和数 PB 敏感信息的公司的项目有多么不同。
【问题讨论】: