【发布时间】:2009-09-18 02:07:14
【问题描述】:
大家好:
我很想从大量的 Google 搜索结果页面中获取一些信息。
我唯一需要的是一堆<cite></cite> HTML 标记中的 URL。
我无法以任何其他适当的方式解决这个问题,所以现在我正在转向 ruby。
这是我目前所写的:
require 'net/http'
require 'uri'
url=URI.parse('http://www.google.com.au')
res= Net::HTTP.start(url.host, url.port){|http|
http.get('/#hl=en&q=helloworld')}
puts res.body
很遗憾,我不能使用推荐的 hpricot ruby gem(因为它错过了 make 命令或其他什么?)
所以我想坚持这种方法。
现在我可以将响应正文作为字符串获取,我唯一需要做的就是检索 ciite 中的任何内容(删除 i 以查看真实名称 :))HTML 标记。
我该怎么做?使用正则表达式?谁能举个例子?
【问题讨论】:
-
您为什么不发布一个问题,了解我们如何帮助您解决 hpricot 问题?
标签: ruby-on-rails ruby rubygems