【问题标题】:Merge Order in Huffman Coding with same weight trees具有相同权重树的霍夫曼编码中的合并顺序
【发布时间】:2015-04-12 17:08:35
【问题描述】:

我真的在为在霍夫曼编码中合并具有相同“权重”的树的顺序而苦苦挣扎。我查看了很多资料,但所有资料似乎都只涵盖“简单案例”,即不超过两个具有相同权重的元素,或者根本不涵盖整个主题。



假设我有以下要编码的字符串:ABCDEE(样式基于this website
所以我有:

    FREQUENCY       VALUE
    ---------       -----
         1            A
         1            B
         1            C
         1            D
         2            E

我现在开始用两个最小的元素构建树:
问题 1) 我必须使用 A & B 还是我如何决定应该使用哪些值?我知道他们必须是最小的,但除此之外呢?例如。 A & D ?
这很重要,因为最后(可以说我做了以下事情:

  2:[A&B]       2:[B&C]
    /  \          /  \
  1:A   1:B     1:B   1:C

还有下表:

    FREQUENCY       VALUE
    ---------       -----
         2          [A&B]
         2          [C&D]
         2            E

问题 2) 再次...我应该按什么顺序合并树?例如。 [A&B]&E[A&B]&[C&D]
因为,如果我先合并[A&B]&E,树会是这样的:

      4:[A&B&E]
        /   \
    2:[A&B]   2:E
    /   \
  1:A   1:B

问题3)以及如何判断2:E应该在左边还是右边?)

加入[C&D] 后,最终的树看起来像这样:

     6:[A&B&C&D&E]
       /       \
 2:[C&D]    4:[A&B&E]
   /  \        /   \
 1:C   1:D  2:[A&B] 2:E
             /   \
           1:A   1:B

但是如果我从加入[A&B]&[C&D]开始:

     4:[A&B&C&D]
      /        \
 2:[A&B]      2:[C&D]
   /   \       /   \
  1:A   1:B  1:C  1:D

然后加入E,最终的树是这样的:

     6:[A&B&C&D&E]
       /       \
    E:2      4:[A&B&C&D]
             /        \
        2:[A&B]      2:[C&D]
          /   \       /   \
         1:A   1:B  1:C  1:D

所以在第一个变体中E 将是11,在第二个变体中0。或者作为另一个例子,C00 而不是 110...

我认为这里一定缺少一条基本规则,因为霍夫曼编码必须是确定性的(才能正确解码),不是吗!?

【问题讨论】:

  • 所有问题的一般答案:合并顺序并不重要,您可以选择任何顺序,这只会影响分配给这个或那个符号的位序列,但是:a)压缩文件将有大小相同。 b) 解压后的文件与原始文件相同(压缩前)。
  • ...所以你必须用编码字符串给出确切的树?因为否则很多树“可能”用于解码并给出错误的结果,对吧?
  • 最简单的解决方案:在编码和解码端使用相同的算法。由于所有计算机算法都是确定性的,因此您将从相同的输入数据向量在两侧生成相同的树。

标签: algorithm encoding tree compression huffman-code


【解决方案1】:

当您对两个最低权重有多个选择时,选择哪一对并不重要。对于所有选择,霍夫曼算法将返回一组代码,以最小化对提供的集合进行编码的总位数。

因此,霍夫曼算法不是确定性的,除非对选择施加其他约束。即使算法可以提供不同的结果,这不会阻止编码器/解码器组合具有确定性。所需要的只是生成的霍夫曼码与编码数据一起正确传输,以便解码器可以对其进行解码。非确定性唯一表明的是符号的频率集不足以描述霍夫曼代码。

正如另一个答案中所述,通过要求code be canonical 来减少大量可能的代码。这减少了传输霍夫曼代码所需的位数,因为您不再需要区分所有可能的结果代码。对于规范代码,您不必描述霍夫曼树或代码的特定位值。这一切都可以从对每个符号进行编码所需的位数简单推导出来。因此,霍夫曼码(或实际上是任何前缀码)的充分描述符是每个符号的位数。

请务必注意,即使您将结果限制为规范代码,霍夫曼算法仍然会为同一组频率产生不同的代码长度集,具体取决于选择两个最低权重子树时做出的选择。这是一个例子:

考虑符号和频率 A: 2, B: 2, C: 1, D: 1。你必须结合 C 和 D 得到权重 2。现在你有三个权重 2,所以三个选择结合。 A 和 B,A 和 CD,或 B 和 CD。第一个选择与后两个选择根本不同。如果将 A 和 B 组合在一起,则生成的代码长度(以位为单位)为:A = 2、B = 2、C = 2 和 D = 2。另一方面,如果将 B 和 CD 组合在一起,则最终得到 A = 1、B = 2、C = 3 和 D = 3。同一组频率的两个不同规范代码!

你可能会问,哪一个是“正确的”?答案是两者都是。原因是如果你将频率乘以长度,你会得到相同的总比特数来对集合进行编码。 2x2 + 2x2 + 1x2 + 1x2 = 2x1 + 2x2 + 1x3 + 1x3 = 12。

因此,即使您将代码限制为规范代码,您也可以从霍夫曼算法中得到多个答案,也不要感到惊讶。

【讨论】:

    【解决方案2】:

    合并顺序真的不重要。在这个算法中重要的是每次选择最小的子树。因为贪婪地这样做,最终,你总是会以最短的方式在那棵树中找到频率最高的字母。

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 2014-03-18
      相关资源
      最近更新 更多