【问题标题】:How does a Data Lake Store Data and what Format?数据湖如何存储数据以及采用什么格式?
【发布时间】:2018-09-09 04:59:37
【问题描述】:

我听说 Data Lakes 可以存储任何类型的数据:关系、NoSql、图片/图像、Adobe Pdf、Excel。 数据是如何存储的,以 No-SQL 格式还是二叉树?或者它只是像普通硬盘一样保存它?如果是这样,他们为什么不把它叫做存储而不是数据湖呢?我正在尝试找到“数据湖”的确切存储机制

【问题讨论】:

    标签: sql image nosql azure-data-lake data-lake


    【解决方案1】:

    数据湖是以自然格式存储的数据系统或存储库,[1] 通常是对象 blob 或文件。数据湖通常是所有企业数据的单一存储,包括源系统数据的原始副本和用于报告、可视化、分析和机器学习等任务的转换数据。数据湖可以包括来自关系数据库(行和列)的结构化数据、半结构化数据(CSV、日志、XML、JSON)、非结构化数据(电子邮件、文档、PDF)和二进制数据(图像、音频、视频)。

    示例:用于托管数据湖的技术示例之一是 Apache Hadoop 中使用的分布式文件系统。

    许多公司还使用云存储服务,例如 Azure Data Lake 和 Amazon S3。[9]学术界对数据湖的概念逐渐产生了兴趣,例如卡迪夫大学的 Personal DataLake[10] 旨在创建一种新型数据湖,旨在通过提供单点收集、组织来管理个人用户的大数据,以及共享个人数据。[11]

    早期的数据湖 (Hadoop 1.0) 的面向批处理 (MapReduce) 的功能有限,并且是唯一与之相关的处理范例。与数据湖交互意味着您必须具备 Java 方面的专业知识,使用 map reduce 和更高级别的工具,如 Apache Pig 和 Apache Hive(它们本身是面向批处理的)。随着 Hadoop 2.0 的出现以及由 YARN(Yet Another Resource Negotiator)接管的资源管理职责分离,流式处理、交互式处理、在线处理等新的处理范式已通过 Hadoop 和 Data Lake 变得可用。

    【讨论】:

    • 还有一个问题,这与存储不同类型文件的硬盘驱动器有何不同?还是一样,带有营销趋势词?谢谢-
    • 嗯,硬盘是一种服务器。服务器是一台计算机以及与其他计算机和程序(通常通过某种形式的网络)共享数据和任务所需的程序。它可能包括一个或多个硬盘驱动器,就像任何计算机也可能包括一个或多个它自己的一样。通常,服务器专用于供其他计算机使用。而且通常它不需要用户不断地告诉它做什么就可以运行。这是主要区别。
    • 服务器听起来很像数据湖,“硬盘就是服务器”
    • 如果这确实对您有所帮助,请继续将我的答案标记为有用。谢谢!
    • 好的,可以,我可能会再问一个帖子,询问存储服务器和数据湖之间的区别
    猜你喜欢
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2019-04-22
    • 1970-01-01
    • 1970-01-01
    • 2017-12-21
    相关资源
    最近更新 更多