【问题标题】:Decoding a Huffman Tree from a File从文件中解码霍夫曼树
【发布时间】:2023-03-22 13:32:02
【问题描述】:

我正在尝试解码霍夫曼代码。

我有一个字符字典,有一个 int 值和一个二进制值以及单词的二进制值,它看起来像这样:

10,000; 121,001; 13,010; 33,011; 100,1000; 32,1001; 104,1010; 101,1011; 111,1100; 108,1101; 119,1110; 114,1111101100111010000

...其中10 - 121 -13 -33等数字是字符的int值,旁边是char的二进制值,然后1和0的序列是代码消息。

从文件 txt 中读取它后,我将其拆分为字符串数组,这样我就可以得到一个以 char 作为键、二进制值作为值的 hashmap。

然后我将它保存在一个节点数组中,这样我就可以轻松获取它们了,问题是这样的:

当我尝试使用字典将二进制消息转换为 char 时,我收到如下消息:

1!y1y111!y11111!

什么时候应该这样:

嘿,世界!!

这是我正在使用的方法:

void decompress() throws HuffmanException, IOException {
    File file = FilesManager.chooseUncompressedFile();
    if (file == null) {
        throw new HuffmanException("No file");
    }
    FileReader read = new FileReader(file);
    BufferedReader buff = new BufferedReader(read);
    String auxText;
    StringBuilder compressFromFile = new StringBuilder();
    do {
        auxText = buff.readLine();
        if (auxText != null) {
            compressFromFile.append(auxText);
        }
    } while (auxText != null);
    String[] auxSplit1 = compressFromFile.toString().split(" ");
    String rest1 = auxSplit1[1];
    String[] auxSplit2 = rest1.split(";");
    System.out.println(auxSplit2[2]);
    HashMap<Integer, String> map = new HashMap<>();
    String[] tomapAux;
    for (int i = 0; i < auxSplit2.length - 2; i++) {
        tomapAux = auxSplit2[i].split(",");

        map.put(Integer.valueOf(tomapAux[0]), tomapAux[1]);
    }
    ArrayList<CharCode> charCodeArrayList = new ArrayList<>();

    map.forEach((k, v) -> charCodeArrayList.add(new CharCode((char) k.intValue(), v)));

    charCodeArrayList.sort(new Comparator<CharCode>() {
        @Override
        public int compare(CharCode o1, CharCode o2) {
            return extractInt(o1.getCode()) - extractInt(o2.getCode());
        }

        int extractInt(String s) {
            String num = s.replaceAll("\\D", "");
            return num.isEmpty() ? 0 : Integer.parseInt(num);
        }
    });

    for (int i = 0; i < charCodeArrayList.size(); i++) {
        System.out.println("Pos " + i + " char: " + charCodeArrayList.get(i).getChr() + " code: " + charCodeArrayList.get(i).getCode());
    }
    String st = auxSplit2[auxSplit2.length - 1];
    System.out.println("before: " + st);
    String newChar = String.valueOf(charCodeArrayList.get(0).getChr());
    String oldChar = charCodeArrayList.get(0).getCode();
    for (CharCode aCharCodeArrayList : charCodeArrayList) {
        st = st.replace(oldChar, newChar);
        newChar = String.valueOf(aCharCodeArrayList.getChr());
        oldChar = aCharCodeArrayList.getCode();
    }
    System.out.println("after : " +st);

}

这是CharCode类:

public class CharCode implements Comparable<CharCode> {
private char chr;
private String code;

public CharCode(char chr, String code) {
    this.chr = chr;
    this.code = code;
}

public char getChr() {
    return chr;
}

public String getCode() {
    return code;
}

@Override
public int compareTo(CharCode cc) {
    return ((int) this.chr) - ((int) cc.getChr());
}

}

这就是我在控制台中看到的:

因此,如果有人可以帮助我改进我的方法,以便我可以得到 hey world!! 而不是 1!y1y111!y11111! !!01,那就太好了!

【问题讨论】:

  • 在填充地图的循环中:为什么使用 for (int i = 0; i &lt; auxSplit2.length - 2; i++) 而不是 for (int i = 0; i &lt; auxSplit2.length - 1; i++) ?您正在跳过最后一个霍夫曼代码
  • @mangusta 我使用它,所以我可以将10,000;121,001;13,010;33,011;etc; 10101011001100111101100111111011000011011010000 分开
  • index of this:10101011001100111101100111111011000011011010000auxSplit2.length-1,前面的其他都是霍夫曼代码,所以你的循环条件必须是for (int i = 0; i &lt; auxSplit2.length - 1; i++)
  • @mangusta 是的,我用它来分隔字符串“父亲”,所有这些都在同一个句子中,然后 10,000;121,001;13,010;33,011;etc; 我将它保存在 CodeChar 的地图中,它就像我看到一个 10 然后一个 000 一样工作,所以我将 int 10 保存为键,将 000 保存为映射中的字符串值
  • 我不确定你在说什么,但你肯定需要按照我告诉你的方式改变循环条件

标签: java file huffman-code


【解决方案1】:

您的程序的问题在于您以错误的方式解码:您获取第一个 Huffman 代码,替换给定字符串中所有出现的位置,然后对下一个 Huffman 代码执行相同操作,依此类推.

这不是解码 Huffman 编码字符串的方式。为了解码 Huffman 编码的字符串,您需要检查字符串的 PREFIX 是否与某些 Huffman 代码相同。这是通过将字符串的前缀与霍夫曼代码一一比较来完成的。

在你的情况下:
迭代 1:10101011001100111101100111111011000011011010000
我们检查000 - 不是前缀
我们检查001 - 不是前缀
我们检查010 - 不是前缀
我们检查011 - 不是前缀
我们检查1000 - 不是前缀
我们检查1001 - 不是前缀
我们检查1010 - 找到一个前缀!它对应于字母h

现在我们从原始字符串中删除这个前缀,所以我们的字符串是
1011001100111101100111111011000011011010000

迭代 2:1011001100111101100111111011000011011010000
合适的前缀是1011,即字母e

第 3 次迭代:001100111101100111111011000011011010000
合适的前缀是001,即字母y

第 4 次迭代:100111101100111111011000011011010000
合适的前缀是1001,它是空格字符

以此类推,直到原始字符串中没有任何内容。

修改后的代码如下:

while(st.length() > 0)
{   

    for(int i_map = 0; i_map < charCodeArrayList.size(); i_map++)
    {
        CharCode cc = charCodeArrayList.get(i_map);

        if(st.startsWith(cc.getCode()))
        {
            System.out.println("found: " +  cc.getChr());
            st = st.substring(cc.getCode().length()); 
            break;
        }//end if

    }//end for      

}//end while

【讨论】:

  • ooooohhhh 我看到了,我做错了,现在很合乎逻辑,非常感谢,你帮了我很多@mangusta,你是最棒的
猜你喜欢
  • 2014-03-18
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 2017-08-18
  • 1970-01-01
  • 2023-03-14
相关资源
最近更新 更多