【发布时间】:2012-06-11 21:22:43
【问题描述】:
所以我正在使用 Java 中的一个庞大数据集,试图清除除字母字符之外的所有文本。现在我正在这样做:
snippet = snippet.toLowerCase();
snippet.replaceAll("[^A-Za-z]", "");
但是,清理工作并未按计划进行。一些无关的@、#、? 和: 正在通过。想法?
【问题讨论】:
-
如果你正在使用
snippet.toLowerCase();,那么你不需要[^A-Za-z],你可以使用[^a-z]。您可能应该这样做,因为在toLowerCase()之后保持大写的任何内容一开始都不是大写字母。我能想到这种情况的唯一方法是将 utf-8 字符串读取为 ascii char 字符串。