【问题标题】:Truncated text when using HtmlUnit to save complete page使用 HtmlUnit 保存完整页面时截断的文本
【发布时间】:2018-11-23 10:13:33
【问题描述】:

我尝试使用 Java 或 Python 保存整个页面,并且我也尝试过 selenium 和 wget。 最后我选择了 HtmlUnit,因为它可以通过使用 save() 轻松实现。

我的页面被截断,汉字显示为“?”。 有没有办法改变编码?或者还有其他工具可以保存完整的页面吗?

我的代码:

    WebClient webClient = new WebClient();
    webClient.getOptions().setUseInsecureSSL(true);

    try {
        HtmlPage htmlPage = webClient.getPage("http://www.fulijr.com/");
        File file = new File("fulijr.html");
        htmlPage.save(file);
    } catch (IOException e) {
        e.printStackTrace();
    }

结果:

<?xml version="1.0" encoding="UTF-8"?>
<html>
    <head>
        <meta charset="utf-8"/>
        <meta http-equiv="X-UA-Compatible" content="IE=edge,chrome=1"/>
        <meta http-equiv="Content-type" content="text/html;charset=utf-8"/>
        <meta name="keywords" content="????,????????,??????P2P????"/>
        <meta name="description" content="??????????P2P???????????????????????????????????????????????????????????????????????????????????P2P???????????????????????????????????????????????????????????????????????????"/>
        ...

【问题讨论】:

标签: java python web-crawler


【解决方案1】:

这是 HtmlUnit 当前版本(2.33 版)中的一个错误。已解决此问题;如果有新的快照版本可用,将通知https://twitter.com/HtmlUnit

【讨论】:

  • 谢谢,我已经尝试构建 2.34-SNAPSHOT 并且它的工作。
  • 这个 2.34 什么时候发布?
猜你喜欢
  • 1970-01-01
  • 2019-06-27
  • 2012-08-14
  • 1970-01-01
  • 2015-01-28
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
相关资源
最近更新 更多