【问题标题】:Help needed on web spider网络蜘蛛需要帮助
【发布时间】:2011-05-31 03:43:17
【问题描述】:

我正在用 java 编写一个非常基本的网络蜘蛛。我面临一个问题,为相同 url 加载的内容与在浏览器中加载的内容不同。例如尝试下面的 URL。

http://www.google.co.in/search?sourceid=chrome&ie=UTF-8&q=web+spider#sclient=psy&hl=en&source=hp&q=web+spider&aq=f&aqi=&aql=&oq=web+spider&pbx=1&fp=d8e8e41d6d2bda33&biw=1366&bih=643

如果你在浏览器中加载这个url,通过JAVA URL类,内容不一样。这可能是因为以下原因。

  • Javascript 可能正在发送
    XMLHTTPrequests 和连接 结果以呈现最终的 HTML。
  • URL 重定向最终可能会呈现 HTML。
  • 任何其他原因,我不知道。

那么有没有一种方法可以在我的 java 程序中模拟浏览器。是否有任何第三方库,可以加载类似于浏览器所做的页面并最终返回内容。感谢任何帮助。

【问题讨论】:

  • 您是否尝试在 java 中包含 USER_AGENT 以匹配您的网络浏览器?
  • Ya..我包含与 IE8 相同的 user_agent,但同样的问题。这是因为浏览器执行的 javascripts 可能会发送 XMLHTTPRequest 并将结果连接起来形成最终内容。那么有没有办法模拟模拟浏览器并获得最终内容。

标签: java html browser web-scraping


【解决方案1】:

试试htmlunit它可以模拟浏览器行为并处理javascript

【讨论】:

  • 非常感谢...对我帮助很大。
猜你喜欢
  • 1970-01-01
  • 2017-12-05
  • 1970-01-01
  • 1970-01-01
  • 2012-03-08
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 2014-02-25
相关资源
最近更新 更多