【发布时间】:2015-08-24 18:40:58
【问题描述】:
当我使用HttpBuilder 解析 HTML 时,如下所示,我没有收到完整的 HTML,正如我在访问该页面并检查时看到的那样。例如,在生成的文件中看不到<img> 标签。
@Grab(group='org.codehaus.groovy.modules.http-builder', module='http-builder', version='0.7' )
import groovyx.net.http.HTTPBuilder
import static groovyx.net.http.Method.GET
import static groovyx.net.http.ContentType.JSON
import groovy.json.*
def http = new HTTPBuilder('http://www.google.com')
def html = http.get(uri: 'http://www.imdb.com/title/tt2004420/', contentType: groovyx.net.http.ContentType.TEXT) { resp, reader ->
def p = new XmlSlurper(new org.cyberneko.html.parsers.SAXParser()).parseText(s)
new File("/Users/../Documents/temp.txt") << p
}
我希望通过解析来获取该 html 页面上的图像数量。
【问题讨论】:
标签: groovy httpbuilder