【发布时间】:2009-05-16 10:54:38
【问题描述】:
在使用 Java 中的 DOM API 处理文本中的“特定”字符时遇到问题。文件为 XML 格式。我在上一篇文章中被告知 XML 中的 & 符号是什么情况(以及其他几个字符,例如 )。这是帖子: Special characters in XML files - processing with the DOM API
但是,我可以如何处理数据中的其他特殊字符,例如德语和法语中的特定字母?例如,我在 XML 文档的文本元素中有单词“façade”。但是,字母“ç”的位置看起来已损坏:当我在 linux 中使用 vim 编辑器打开文件时,它看起来像:“fa^Zade”,当我使用另一个编辑器将其作为 .txt 或 .xml 文件打开时, “ç”的位置看起来像一个小的空矩形(或空白空间)。德语变音符号和其他语言的其他“特殊”符号也是如此。当我尝试使用 XML 解析器处理文件时,它们会出现问题(我遇到解析错误)。我想这是一些编码问题。在 XML 文件的标题中,我使用的是 encoding="UTF-8"。我试图改变它(即“Unicode”或其他),但它没有帮助。
我怎样才能让这些特殊字符被识别?我应该使用一些特殊的编码吗?
如果它们只是两个或三个字符,我肯定知道,我可以在使用 Java 中的 DOM API 处理之前替换它们,就像我使用与符号 (&) 符号所做的那样(我已将 & 转换为 &) ,但是,它们很多,并且可能是任何“特殊”符号。
问题是否来自数据的保存方式?例如,在保存过程中应该使用特殊编码 (?),以便现在可以识别字符 (?)。 (我自己没有保存数据)。
谢谢。
【问题讨论】: