【发布时间】:2018-02-13 08:51:02
【问题描述】:
我正在尝试使用 Jsoup 从网站中提取信息,但我没有获得与浏览器中相同的 HTML 代码。
我尝试使用.userAgent(),但没有成功。我目前使用以下适用于 Amazon.com 的功能:
public static String getHTML(String urlToRead) throws Exception {
StringBuilder result = new StringBuilder();
URL url = new URL(urlToRead);
HttpURLConnection conn = (HttpURLConnection) url.openConnection();
conn.setRequestProperty("User-Agent", "Mozilla/5.0 (Windows NT 5.1; rv:19.0) Gecko/20100101 Firefox/19.0");
conn.setRequestMethod("GET");
BufferedReader rd = new BufferedReader(new InputStreamReader(conn.getInputStream(), "UTF-8"));
String line;
while ((line = rd.readLine()) != null) {
result.append(line);
}
rd.close();
return result.toString();
}
我要解析的网站是http://www.asos.com/,但始终缺少产品的价格。
我喜欢this topic,它与我的非常接近,但我想只使用 java 而不是外部应用程序。
【问题讨论】:
-
当您说
I would like to do it using only java and no external app.时,您的意思是您不想使用诸如org.Jsoup和org.Json之类的第三方库吗?
标签: java web-scraping jsoup