【发布时间】:2011-03-09 00:56:01
【问题描述】:
我正在使用 htmlunit 尝试打开一个站点,但我不断收到 404 错误。该网站可以在我的 python 脚本和浏览器中运行,但由于某种原因不能在 html 单元中运行。我认为我的 URL 本身很好,但它似乎在站点内打开另一个站点并且失败(example.com/SharedResources/Default/js/coda_bubble/jquery.codabubble.js)
对于熟悉 htmlunit 的人,有什么方法可以让它不自动加载网站的这些其他区域?还是更优雅地处理网站上的错误?
非常感谢。
【问题讨论】:
标签: java screen-scraping web-scraping htmlunit