【发布时间】:2011-05-31 03:43:17
【问题描述】:
我正在用 java 编写一个非常基本的网络蜘蛛。我面临一个问题,为相同 url 加载的内容与在浏览器中加载的内容不同。例如尝试下面的 URL。
如果你在浏览器中加载这个url,通过JAVA URL类,内容不一样。这可能是因为以下原因。
- Javascript 可能正在发送
XMLHTTPrequests 和连接 结果以呈现最终的 HTML。 - URL 重定向最终可能会呈现 HTML。
- 任何其他原因,我不知道。
那么有没有一种方法可以在我的 java 程序中模拟浏览器。是否有任何第三方库,可以加载类似于浏览器所做的页面并最终返回内容。感谢任何帮助。
【问题讨论】:
-
您是否尝试在 java 中包含 USER_AGENT 以匹配您的网络浏览器?
-
Ya..我包含与 IE8 相同的 user_agent,但同样的问题。这是因为浏览器执行的 javascripts 可能会发送 XMLHTTPRequest 并将结果连接起来形成最终内容。那么有没有办法模拟模拟浏览器并获得最终内容。
标签: java html browser web-scraping