【问题标题】:why does python dataFrames' are localted only in the same machine?为什么 python dataFrames' 只位于同一台机器上?
【发布时间】:2020-12-20 17:34:27
【问题描述】:

我正在阅读激发权威指南,其中说:

Python/R DataFrames 存在于一台机器上而不是多台机器上...这将您可以对给定 DataFrame 执行的操作限制为该特定机器上存在的资源..

因此,我想知道为什么 Python 的 dataFrame 不能跨越多台机器?如果这意味着python没有分发?
更新
Python/R 是否有类似 Spark scala/java 的等效分布式 DataFrame??DataFrame

【问题讨论】:

    标签: python dataframe apache-spark pyspark apache-spark-dataset


    【解决方案1】:

    Pandas 不允许您将 datframe 分发到它自己的多台机器上。当您有数据时,这对我们有好处

    • 适合内存 (RAM)
    • 适合磁盘

    因此,当您拥有可以用单机处理的数据时,它会很好地工作。但是当数据和处理需求增长时,您希望转移到存储和处理数据帧的分布式/并行处理的库。数据框的概念在这些库中很常见,但实现方式不同以提供分布式处理能力。两个很好的例子是

    1. Dask,它通常在单个机器上使用多个cores/thread by multiprocessing/multitasking,但也可以在分布式集群上运行良好。
    2. Apache spark主要用于多节点集群模式,因此是分布式数据处理框架。 (但也可以在单机上使用)

    更新

    你问过这个

    DataFrame CONCEPT 不是分布式的,但是 R 和 Python还有其他的概念来做分布式计算

    Dataframe 不需要是非分布式的或分布式的,它是一个概念,DataFrame 是一个二维数据结构,其列可以有不同的类型,查询、汇总和操作非常简单高效它被许多面向数据的编程范式和库采用。因此,利用和操作这些数据帧也可以以分布式方式完成,以处理大数据。 Spark 只是分布式数据处理框架的一个例子,它可以与包括 R 和 Python 在内的多种语言一起使用

    【讨论】:

    • Okeey,总而言之,DataFrame CONCEPT 是非分布式的,但是 R 和 Python 有其他的概念来进行分布式计算
    • 我已经更新了答案以包含您的问题
    【解决方案2】:

    例如,pandas DataFrame 是不分布式的。

    声明说 DataFrame 不是唯一的,有几个 DataFrame 概念。虽然有很多概念,但 spark DataFrame 是分布式的,而其他的,即 python 和 R 不是。

    这并不意味着 pyspark DataFrame。

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 2019-09-05
      • 1970-01-01
      • 1970-01-01
      • 2021-02-03
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      相关资源
      最近更新 更多