【发布时间】:2014-07-31 23:07:49
【问题描述】:
我有一个程序必须解码 base 64 字符串,然后将其再次解码为 UTF-8。该程序从 .doc 中提取文本,然后从 Dropbox 本地下载(使用 Temboo)。文档前后还是有奇怪的字符。这是页面的一部分在 Microsoft Word 2011 for Mac 中的样子:
我试图将文本放入在线文本解码器中,但似乎无法找到上述文本块的编码方式。这就是我目前解码文本的方式:
encoded = encoded.replaceAll("\r\n", "");
encoded = encoded.replaceAll("\n", "");
encoded = encoded.replaceAll("\r", "");
// decoding the response
decoded = StringUtils.newStringUtf8(Base64.decodeBase64(encoded));
在 TextEdit.app 中看起来像这样:
有谁知道这是什么编码以及如何解码这些字符?
【问题讨论】:
-
好像是二进制头。这可以是 Microsoft Word 文档吗?
-
是的,它是一个 .doc 文件
-
“解码 base 64 并编码为 UTF-8”没有意义。 Base 64 用于编码任意二进制数据,不能将任意二进制数据编码为 UTF-8。
-
这个问题似乎离题了,因为它是关于做一些没有意义的事情。
-
我的解释可能没有意义,但我提供的图片和男女同校确实有道理。所以请推翻你的反对票,因为你为什么反对没有意义@HotLicks