【问题标题】:Java serialization vs Hadoop serialization vs Spark serializationJava 序列化 vs Hadoop 序列化 vs Spark 序列化
【发布时间】:2018-11-10 13:02:22
【问题描述】:

我参与了JavaSerializationDeserialization 进程,并试图理解HadoopSpark 的相同过程。

谁能告诉我HadoopSparkJava的序列化过程的区别。

【问题讨论】:

  • 请多描述一点。你在什么情况下阅读serialization?你能举几个例子吗?

标签: java apache-spark hadoop serialization deserialization


【解决方案1】:

Hadoop 有自己的序列化接口(Writable),旨在使产生的垃圾尽可能少。当 mapper 或 reducer 运行时,实现它的对象是可变的和重用的,从而进一步降低了垃圾量。设计合理的 Writables 也可以由不同版本的代码编写,解决了 Serializable 固有的问题。

Spark 没有自己的序列化,默认使用原生 java 序列化。它的性能不是很好,并且可以使 spark 使用Kryo,这有时会带来 10 倍的性能提升。但是,在使用 Kryo 时,所有自定义类都应在运行作业之前在 SparkConf 中注册。

【讨论】:

    猜你喜欢
    • 2020-04-05
    • 2012-06-21
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2014-12-30
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多