【问题标题】:Java GZip makes small differences when compressing file and decompressing it againJava GZip 在压缩文件和再次解压缩时会产生细微差别
【发布时间】:2018-03-23 16:34:10
【问题描述】:

经过一周的工作,我设计了一种二进制文件格式,并为它制作了一个 Java 阅读器。这只是一个实验,效果很好,除非我使用的是 GZip 压缩功能。

我把我的二进制类型叫做MBDF(Minimal Binary Database Format),它可以存储8种不同的类型:

  • 整数(没有像字节、短、长或类似的东西,因为它存储在灵活空间中(更大的数字占用更多空间))
  • Float-32(32 位浮点格式,类似于 java 的 float 类型)
  • Float-64(64 位浮点格式,类似于 java 的 double 类型)
  • 字符串(UTF-16 格式的字符串)
  • 布尔值
  • Null(只指定一个空值)
  • 数组(类似于java的ArrayList<Object>
  • 复合(A String - Object 映射)

我用这个数据作为测试数据:

COMPOUND {
    float1: FLOAT_32 3.3
    bool2: BOOLEAN true
    float2: FLOAT_64 3.3
    int1: INTEGER 3
    compound1: COMPOUND {
        xml: STRING "two length compound"
        int: INTEGER 23
    }
    string1: STRING "Hello world!"
    string2: STRING "3"
    arr1: ARRAY [
        STRING "Hello world!"
        INTEGER 3
        STRING "3"
        FLOAT_32 3.29
        FLOAT_64 249.2992
        BOOLEAN true
        COMPOUND {
            str: STRING "one length compound"
        }
        BOOLEAN false
        NULL null
    ]
    bool1: BOOLEAN false
    null1: NULL null
}

复合词中的xml 键很重要!!

我使用这个 java 代码从中创建了一个文件:

MBDFFile.writeMBDFToFile(
    "/Users/<anonymous>/Documents/Java/MBDF/resources/file.mbdf", 
    b.makeMBDF(false)
);

这里,变量b 是一个MBDFBinary 对象,包含上面给出的所有数据。使用makeMBDF 函数,它会生成 ISO 8859-1 编码字符串,如果给定的布尔值是true,它会使用 GZip 压缩字符串。然后,在写入时,会在文件开头添加一个额外的信息字符,其中包含有关如何读回文件的信息。

然后,写入文件后,我将它读回java并解析它

MBDF mbdf = MBDFFile.readMBDFFromFile("/Users/<anonymous>/Documents/Java/MBDF/resources/file.mbdf");
System.out.println(mbdf.getBinaryObject().parse());

这将准确打印上述信息。

然后我尝试使用压缩:

MBDFFile.writeMBDFToFile(
    "/Users/<anonymous>/Documents/Java/MBDF/resources/file.mbdf", 
    b.makeMBDF(true)
);

我读回它的方法与处理未压缩文件的方法完全相同,这应该可以工作。它打印以下信息:

COMPOUND {
    float1: FLOAT_32 3.3
    bool2: BOOLEAN true
    float2: FLOAT_64 3.3
    int1: INTEGER 3
    compound1: COMPOUND {
        xUT: STRING 'two length compound'
        int: INTEGER 23
    }
    string1: STRING 'Hello world!'
    string2: STRING '3'
    arr1: ARRAY [
        STRING 'Hello world!'
        INTEGER 3
        STRING '3'
        FLOAT_32 3.29
        FLOAT_64 249.2992
        BOOLEAN true
        COMPOUND {
            str: STRING 'one length compound'
        }
        BOOLEAN false
        NULL null
    ]
    bool1: BOOLEAN false
    null1: NULL null
}

与最初的信息相比,名称xml由于某种原因变成了xUT...

经过一些研究,我发现压缩前和压缩后的二进制数据差别不大。 110011等模式变为101010

当我将名称 xml 加长时,例如 xmldm,由于某种原因,它只是被解析为 xmldm。 我目前看到这个问题只出现在三个字符的名字上。

直接压缩和解压生成的字符串(不保存到文件并读取)确实有效,所以这个错误可能是由文件编码引起的。

据我所知,字符串输出采用 ISO 8859-1 格式,但我无法正确编码文件。当一个文件被读取时,它被读取为它必须被读取,并且所有字符都被读取为 ISO 8859-1 字符。

我有一些事情可能是一个原因,我实际上不知道如何测试它们:

  • GZip 输出的编码与未压缩的编码不同,因此在存储为文件时会产生细微差别。
  • 文件存储为UTF-8格式,忽略顺序为ISO 8859-1编码(不知道怎么解释:))
  • java GZip 库中有一个小错误。

但是哪一个是正确的,如果没有一个是正确的,那么这个错误的真正原因是什么?

我现在想不通。

MBDFFile 类,读取和存储文件:

/* MBDFFile.java */
package com.redgalaxy.mbdf;

import java.io.*;
import java.nio.file.Files;
import java.nio.file.Path;
import java.nio.file.Paths;

public class MBDFFile {
    public static MBDF readMBDFFromFile(String filename) throws IOException {

//        FileInputStream is = new FileInputStream(filename);
//        InputStreamReader isr = new InputStreamReader(is, "ISO-8859-1");
//        BufferedReader br = new BufferedReader(isr);
//
//        StringBuilder builder = new StringBuilder();
//
//        String currentLine;
//
//        while ((currentLine = br.readLine()) != null) {
//            builder.append(currentLine);
//            builder.append("\n");
//        }
//
//        builder.deleteCharAt(builder.length() - 1);
//
//
//        br.close();

        Path path = Paths.get(filename);
        byte[] data = Files.readAllBytes(path);

        return new MBDF(new String(data, "ISO-8859-1"));
    }

    private static void writeToFile(String filename, byte[] txt) throws IOException {
//        BufferedWriter writer = new BufferedWriter(new FileWriter(filename));
////        FileWriter writer = new FileWriter(filename);
//        writer.write(txt.getBytes("ISO-8859-1"));
//        writer.close();
//        PrintWriter pw = new PrintWriter(filename, "ISO-8859-1");
        FileOutputStream stream = new FileOutputStream(filename);
        stream.write(txt);
        stream.close();
    }

    public static void writeMBDFToFile(String filename, MBDF info) throws IOException {
        writeToFile(filename, info.pack().getBytes("ISO-8859-1"));
    }
}

pack 函数生成文件的最终字符串,采用 ISO 8859-1 格式。

有关所有其他代码,请参阅我的MBDF Github repository

我评论了我尝试过的代码,试图展示我尝试过的内容。

我的工作区: - Macbook Air '11 (High Sierra) - IntellIJ 社区 2017.3 - JDK 1.8

我希望这是足够的信息,这实际上是明确我在做什么以及到底什么不起作用的唯一方法。


编辑:MBDF.java

/* MBDF.java */
package com.redgalaxy.mbdf;

import java.io.IOException;
import java.io.UnsupportedEncodingException;

public class MBDF {

    private String data;
    private InfoTag tag;

    public MBDF(String data) {
        this.tag = new InfoTag((byte) data.charAt(0));
        this.data = data.substring(1);
    }

    public MBDF(String data, InfoTag tag) {
        this.tag = tag;
        this.data = data;
    }

    public MBDFBinary getBinaryObject() throws IOException {
        String uncompressed = data;
        if (tag.isCompressed) {
            uncompressed = GZipUtils.decompress(data);
        }
        Binary binary = getBinaryFrom8Bit(uncompressed);
        return new MBDFBinary(binary.subBit(0, binary.getLen() - tag.trailing));
    }

    public static Binary getBinaryFrom8Bit(String s8bit) {
        try {
            byte[] bytes = s8bit.getBytes("ISO-8859-1");
            return new Binary(bytes, bytes.length * 8);
        } catch( UnsupportedEncodingException ignored ) {
            // This is not gonna happen because encoding 'ISO-8859-1' is always supported.
            return new Binary(new byte[0], 0);
        }
    }

    public static String get8BitFromBinary(Binary binary) {
        try {
            return new String(binary.getByteArray(), "ISO-8859-1");
        } catch( UnsupportedEncodingException ignored ) {
            // This is not gonna happen because encoding 'ISO-8859-1' is always supported.
            return "";
        }
    }

    /*
     * Adds leading zeroes to the binary string, so that the final amount of bits is 16
     */
    private static String addLeadingZeroes(String bin, boolean is16) {
        int len = bin.length();
        long amount = (long) (is16 ? 16 : 8) - len;

        // Create zeroes and append binary string
        StringBuilder zeroes = new StringBuilder();
        for( int i = 0; i < amount; i ++ ) {
            zeroes.append(0);
        }
        zeroes.append(bin);

        return zeroes.toString();
    }

    public String pack(){
        return tag.getFilePrefixChar() + data;
    }

    public String getData() {
        return data;
    }

    public InfoTag getTag() {
        return tag;
    }

}

这个类包含pack() 方法。 data 已在此处压缩(如果应该压缩)。

其他课程请关注 Github 仓库,我不想让我的问题太长。

【问题讨论】:

  • 这个pack()方法有什么作用?
  • 引用我的问题:“pack 函数生成文件的最终字符串,采用 ISO 8859-1 格式。”
  • 问题应该是独立的,我建议您在问题中包含该代码。
  • 我不知道你是如何构造压缩数据的,但如果我不得不猜测,你正在尝试将纯二进制数据转换为字符串,这不会起作用:不是所有字节值产生 ISO-8859-1 中的有效字符,所以一些字节会映射到字符?,从而导致以后解压时出错。

标签: java binary gzip utf iso-8859-1


【解决方案1】:

自己解决了!

好像是读写系统。当我导出文件时,我使用 ISO-8859-1 表创建了一个字符串以将字节转换为字符。我将该字符串写入了一个文本文件,即 UTF-8。最大的问题是我使用FileWriter 实例来编写它,它是用于文本文件的。

阅读使用逆系统。完整的文件作为字符串被读入内存(消耗内存!!),然后被解码。

我不知道文件是二进制数据,它们的特定格式形成文本数据。 ISO-8859-1 和 UTF-8 是其中的一些格式。我遇到了 UTF-8 的问题,因为它将一些字符分成两个字节,我无法管理......

我的解决方案是使用流。 Java中存在FileInputStreams和FileOutputStreams,可以用来读写二进制文件。我没有使用流,因为我认为没有太大区别(“文件是文本,所以有什么问题?”),但是有......我实现了这个(通过编写新的类似库),我现在能够将每个输入流传递给解码器,并将每个输出流传递给编码器。要制作未压缩的文件,您需要传递FileOutputStream。 GZipped 文件可以使用GZipOutputStreams,依赖于FileOutputStream。如果有人想要一个带有二进制数据的字符串,可以使用ByteArrayOutputStream。同样的规则适用于阅读,其中应使用上述流的InputStream 变体。

不再有 UTF-8 或 ISO-8859-1 问题,而且它似乎可以工作,即使使用 GZip!

【讨论】:

    猜你喜欢
    • 2019-01-03
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2012-09-25
    • 2023-03-18
    • 1970-01-01
    相关资源
    最近更新 更多