【发布时间】:2018-06-12 16:28:33
【问题描述】:
在 Spark 编程指南中,序列化 RDD 被提及为减少内存使用的技术之一。根据我的理解序列化是将对象转换为字节,以便可以轻松地将对象保存到存储中。那么它如何占用更少的空间?
【问题讨论】:
标签: java apache-spark serialization
在 Spark 编程指南中,序列化 RDD 被提及为减少内存使用的技术之一。根据我的理解序列化是将对象转换为字节,以便可以轻松地将对象保存到存储中。那么它如何占用更少的空间?
【问题讨论】:
标签: java apache-spark serialization
使用 Spark 版本 2.x.x,正如它在内存调整文档中提到的那样,Java 对象对原始数据有开销,例如指向类的指针、使用包装器对象的集合或用于原始类型集合的装箱对象。当对象被序列化时,这些开销不会被存储。
但是由于数据是作为序列化字节数组存储在分区中的,所以需要反序列化才能使用,可能比较耗时。
【讨论】: