【问题标题】:Read site source: � characters [duplicate]阅读网站来源:�字符[重复]
【发布时间】:2013-03-08 22:27:52
【问题描述】:

我正在尝试从浏览器中读取源代码,但当代码中包含 ã、á、à、õ 等字符时,我会得到 �。

我尝试在读取行上应用java.nio.Charset.encode,但没有结果:同样的事情发生了。

我的代码是:

URLConnection connection = ...;
BufferedReader reader = new BufferedReader(connection.getInputStream());
String s = null;

while ((s = reader.readLine()) != null) {
  // got new source line...
}

我要阅读的网站是this one (PT-BR)。

【问题讨论】:

    标签: java string url inputstream bufferedreader


    【解决方案1】:

    根据元标记,该页面上的字符集是 ISO-8859-1。尝试使用:

    Scanner scanner = new Scanner(connection.getInputStream(), "ISO-8859-1");
    

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 2014-03-13
      • 2011-02-07
      • 1970-01-01
      • 2016-11-05
      • 2010-12-02
      • 1970-01-01
      • 2020-11-24
      • 2018-06-18
      相关资源
      最近更新 更多