【发布时间】:2012-07-11 17:24:44
【问题描述】:
我正在尝试将输入流中的字节编码为纯文本字符。所以,我用空格分隔的整数组成了字符串,如下所示:
InputStream in;
//etc
int b;
String finalString="";
while((b=in.read())!=-1)finalString+=""+b+" ";
in.close()
但问题是,这使得字符串比原始字节大 3-4 倍。有没有其他方法可以将字节编码为纯文本?
【问题讨论】:
我正在尝试将输入流中的字节编码为纯文本字符。所以,我用空格分隔的整数组成了字符串,如下所示:
InputStream in;
//etc
int b;
String finalString="";
while((b=in.read())!=-1)finalString+=""+b+" ";
in.close()
但问题是,这使得字符串比原始字节大 3-4 倍。有没有其他方法可以将字节编码为纯文本?
【问题讨论】:
如果我理解正确,您想将二进制数据转换为纯文本。您应该为此使用 Base64。损失系数只有 4/3。
Apache commons-codec 有一个 Base64 编码器(和解码器)的免费实现。
另一种可能是十六进制编码(commons-codec 也支持),但每个二进制数据字节需要 2 个字节的文本。
【讨论】:
您可以获取所有字节并将它们输出到一个字节数组中,然后使用字节数组创建字符串。
即
String newString = new String(byteArray);
【讨论】:
您当前的解决方案生成的字符串比文件中的内容长 3..4 倍,因为它将十进制字符代码连接成一个字符串。
Java 提供了一种无需编写循环即可从流中读取字符串的方法,如下所示:
InputStream in;
BufferedReader r = new BufferedReader(new InputStreamReader(in, "UTF8"));
String s = r.readLine();
【讨论】:
readAllLines 来避免读取循环。
关注文档here
例如,如果您的字符串是 UTF8:
byte[] bytes = // you got that from somewhere...
String x = new String(bytes, "UTF8");
【讨论】:
Commons-codec 有 methods 将字节编码为 Base64 编码。
encodedText = new String(
org.apache.commons.codec.binary.Base64.encodeBase64(byteArray));
【讨论】:
如果您可以将所有内容集中到一个 byte[] 中,那么应该就是
new String(byteArray, StandardCharsets.UTF_16LE);
或您希望输入使用的任何字符编码。
【讨论】:
byte[] 也有类似的困难。也就是说,使用 ByteStreams.toByteArray(InputStream) 和 Guava 这样的实用程序相当简单。