【发布时间】:2015-07-28 10:16:11
【问题描述】:
我目前正在使用 Ruby on Rails(Ruby:2.2.1,Rails:4.2.1)构建网站,并希望从特定网站提取数据,然后将其显示出来。我使用 Nokogiri 来获取网页的内容。我正在寻找的是获取该网站的所有页面并获取其内容。
在我的代码下面:
doc = Nokogiri::HTML(open("www.google.com").read)
puts doc.at_css('title').text
puts doc.to_html
【问题讨论】:
-
你需要的代码很复杂,你用它写了大约 1% 的东西。您基本上需要遍历页面上的所有链接,当您获取时,过滤掉外部链接,并存储一组已获取的页面,以避免重复调用。
-
你应该搜索 Stack Overflow。沿着这条线有很多问题。以下是一些提示:stackoverflow.com/a/4981595/128421
标签: ruby-on-rails ruby nokogiri